Familias ocultas

Datos abiertos

Los datos son públicos: descárgalos tú

No necesitas descargar todo Gaia ni tener un telescopio. Basta con pedir una región, unas columnas y unos filtros adecuados a tu pregunta.

12 206filas en la muestra de las Pléyades
≈2,27MBen formato CSV
Gratissin cuenta ni pago
  1. 1Tres caminos
  2. 2Construye tu consulta
  3. 3En el archivo web
  4. 4Con Python
  5. 5Qué significa cada columna
  6. 6Abre y analiza
  7. 7Para que otros lo repitan

1 · Acceso

Tres caminos hacia el mismo catálogo

Archivo web

Explora las tablas y escribe consultas ADQL directamente en el navegador. Ideal para empezar.

TAP y astroquery

TAP es el protocolo de consulta; astroquery es una biblioteca de Python que permite repetir y automatizar las consultas.

DataLink

Da acceso a productos asociados, como espectros y curvas de luz, cuando existen para una fuente.

ADQL (Astronomical Data Query Language) es un lenguaje de consultas muy parecido a SQL, con funciones para geometría en el cielo. Si nunca has usado SQL, no importa: el constructor de abajo escribe la consulta por ti y explica cada línea.

También puedes usar TOPCAT, un programa gratuito para explorar tablas astronómicas que se conecta al mismo servicio TAP.

2 · Herramienta

Construye tu consulta

Elige una región y unos filtros. La consulta, el código de Python y el enlace de descarga se actualizan al instante.

Región del cielo
Filtros de calidad
Columnas
Descargar CSV desde Gaia Se abre en otra pestaña y el servidor de Gaia devuelve el archivo. Una región pequeña tarda segundos; una grande puede tardar o agotar el tiempo.

Qué hace cada línea

    TOP impone un máximo de filas. Si una descarga devuelve exactamente ese número, probablemente está incompleta: sube el límite o reduce la región. Los centros de los cúmulos de ejemplo son aproximados; los filtros dejan fuera parte de la población real (por ejemplo, estrellas binarias).

    3 · Paso a paso

    Descargar desde el archivo web

    El camino más directo: sin instalar nada y sin crear una cuenta.

    El archivo avisa que, mientras se prepara Gaia DR4, puede estar inestable y algunas consultas pueden agotar el tiempo. Para trabajos grandes o frecuentes recomienda registrarse; para una región pequeña no hace falta.

    1. Abre el archivo

      Entra en gea.esac.esa.int/archive. Si aparece un aviso, ciérralo.

    2. Ve a «Search» y elige «Advanced (ADQL)»

      Es el editor donde se escriben las consultas. A la izquierda verás la lista de tablas; la principal es gaiadr3.gaia_source.

    3. Pega tu consulta

      Copia la consulta ADQL del constructor de arriba y pégala en el cuadro de texto.

    4. Pulsa «Submit Query»

      El archivo crea un trabajo («job»). Espera a que su estado indique que terminó.

    5. Elige el formato y descarga

      En «Download format» elige CSV (se abre en cualquier hoja de cálculo o en Python) y descarga el resultado del trabajo.

    6. Anota lo que hiciste

      Guarda la consulta, la fecha de descarga y el número de filas junto al archivo. Sin eso, nadie podrá repetir tu experimento.

    4 · Programático

    Repetir la consulta con Python

    Con astroquery, la misma consulta se ejecuta desde un programa. Así puedes repetirla, cambiar un parámetro o automatizar decenas de regiones.

    1. Instala las bibliotecas

      Una sola vez, en la terminal:

    pip install astroquery pandas matplotlib
    1. Ejecuta la consulta

      El código de la pestaña «Python» del constructor envía la consulta como trabajo asíncrono, convierte el resultado en una tabla de pandas y la guarda en CSV.

    2. Comprueba el número de filas

      Con los filtros de la conferencia deberías obtener 12 206. Si obtienes exactamente el valor de TOP, el resultado está truncado.

    Cuidado con source_id. Es un entero de hasta 19 cifras. Las hojas de cálculo y JavaScript solo conservan unas 15–16 cifras exactas y lo redondean en silencio. Léelo siempre como texto: en pandas, dtype={"source_id": str}.

    5 · Diccionario

    Qué significa cada columna

    Las columnas que usamos en la conferencia, con sus unidades.

    ColumnaUnidadQué es
    source_id—Identificador único de la fuente en Gaia DR3. Guárdalo como texto.
    ra, decgradosAscensión recta y declinación (sistema ICRS, época de referencia J2016.0).
    parallaxmasParalaje ϖ. Para paralajes precisos, d (pc) ≈ 1000 / ϖ.
    parallax_errormasIncertidumbre (1σ) del paralaje.
    parallax_over_error—Paralaje dividido por su error: una medida de señal sobre ruido.
    pmramas/añoMovimiento propio en ascensión recta, μα* (ya incluye el factor cos δ).
    pmdecmas/añoMovimiento propio en declinación, μδ.
    pmra_error, pmdec_errormas/añoIncertidumbres de los movimientos propios.
    phot_g_mean_magmagMagnitud media en la banda G. Números menores = más brillante.
    bp_rpmagColor BP − RP. Mayor valor = estrella más roja y, en general, más fría.
    ruwe—Calidad del ajuste astrométrico (cerca de 1 es bueno). No mide pertenencia a un cúmulo.
    radial_velocitykm/sVelocidad a lo largo de la línea de visión. Solo existe para unos 33,8 millones de fuentes.

    6 · Primer análisis

    Abre los datos y reproduce la selección

    Descarga la muestra exacta de la conferencia y repite en pocas líneas la selección de 586 candidatas y su diagrama color-magnitud.

    import numpy as np
    import pandas as pd
    import matplotlib.pyplot as plt
    
    # 1. Leer la tabla (source_id como texto para no perder cifras)
    df = pd.read_csv("gaia_dr3_pleyades.csv", dtype={"source_id": str})
    print(len(df), "fuentes")                     # 12206
    
    # 2. Regla explícita: paralaje entre 5 y 9 mas y movimiento a menos
    #    de 6 mas/año del punto (20, -45)
    en_paralaje = df.parallax.between(5, 9, inclusive="neither")
    en_movimiento = np.hypot(df.pmra - 20, df.pmdec + 45) < 6
    cand = df[en_paralaje & en_movimiento]
    print(len(cand), "candidatas")                 # 586
    print("mediana del paralaje:", cand.parallax.median())   # ≈ 7.36 mas
    
    # 3. Magnitud absoluta aproximada (sin extinción ni punto cero)
    MG_todas = df.phot_g_mean_mag + 5 * np.log10(df.parallax) - 10
    MG_cand = cand.phot_g_mean_mag + 5 * np.log10(cand.parallax) - 10
    
    # 4. Diagrama color-magnitud
    plt.figure(figsize=(5, 6))
    plt.scatter(df.bp_rp, MG_todas, s=1, c="0.7", label="muestra")
    plt.scatter(cand.bp_rp, MG_cand, s=4, c="teal", label="candidatas")
    plt.xlim(-0.5, 4); plt.ylim(14, -4)                # brillantes arriba
    plt.xlabel("Color BP − RP (mag)"); plt.ylabel("M_G (mag)")
    plt.legend(); plt.show()

    La selección usa conocimiento previo de una región conocida: no es un descubrimiento automático ni certifica pertenencia. Prueba a cambiar los cortes y explica por qué cambia el resultado.

    7 · Ciencia reproducible

    Para que otra persona pueda repetirlo

    Un experimento con datos públicos solo es útil si otro puede rehacerlo. Antes de compartir resultados, marca lo que ya guardaste.

    Siguiente
    ¿Cómo aprende una red neuronal con estos datos?
    Ir a redes neuronales →