Metodología

Copernicus Hidro — sistema de predicción de marea del río Luján con alerta temprana · estación San Fernando

Este servicio pronostica la altura hidrométrica del río Luján en San Fernando (escala del INA, serie 52) para las próximas 30 horas, combinando la marea astronómica con un modelo estadístico del efecto meteorológico, entrenado sobre la serie horaria 2011-2021 y validado sobre 2022-2026 — 15 años de mediciones en total.

Este sistema forma parte de la plataforma Copernicus, distinguida con el 1er Premio CarpinchIA 2026 de la Universidad Nacional del Delta.

1. El enfoque: descomponer la señal

La altura del río en la zona del bajo Luján / Delta es la suma de dos componentes de naturaleza muy distinta:

El pronóstico publicado es: marea astronómica (calculada) + residuo (modelado).

2. Datos utilizados

En síntesis: el agua sale del INA (alturas observadas, en histórico y en vivo); el cielo sale de ERA5 para el pasado (entrenamiento) y de Open-Meteo para el futuro (operación), sobre los mismos 6 puntos geográficos; la marea la calculamos nosotros a partir de la propia serie (sección 3). El detalle:

FuenteSerieFrecuencia y rangoRol
INA — red de alerta San Fernando (serie 52)Horaria, 2011→hoy (diaria 2006-2010) Variable objetivo; ~128.000 observaciones. El modelo y el análisis de marea usan solo el tramo horario 2011→hoy (~15 años): el tramo diario inicial no resuelve la escala horaria del fenómeno
INATigre (49) y Dique Luján (50)Diaria, 2006→hoy Contexto y mapeo de niveles aguas arriba
INAParaná en Rosario (serie 34)Diaria, histórica→hoy Proxy del caudal del Paraná (estado de fondo del estuario) — en entrenamiento y en operación
ERA5 (Copernicus/ECMWF) Viento 10 m (u,v), presión a nivel del mar y precipitaciónHoraria, 2006→2026 Meteorología histórica para entrenamiento: 3 puntos sobre el estuario — frente a San Fernando, estuario medio y Río de la Plata exterior (el punto aguas afuera anticipa la onda de sudestada: lead time) — más presión en los extremos del eje (gradiente = driver físico de la sobre-elevación) y lluvia en 3 puntos de la cuenca (Mercedes, Luján, Pilar)
Open-Meteo Mismas variables, mismos 6 puntosPronóstico a 3 días Meteorología futura en operación — ensemble de 7 modelos numéricos (ECMWF, GFS, ICON, UKMO, Météo-France, GEM, JMA) promediados por componentes, más 82 miembros perturbados (ECMWF ENS 51 + NOAA GEFS 31) que alimentan la banda de alerta dinámica. En el punto costero (frente a San Fernando) el viento se recalibra por quantile mapping contra la distribución de ERA5 con la que se entrenó: promediar el ensemble suaviza los picos, y esta corrección los devuelve sin alterar el tiempo calmo (ver sección 4)
INA — pronóstico oficialSan Fernando (26202) y Luján frente Delta (6066) ~4 días, corrida ~diaria Archivado por este servicio (el INA no publica histórico de pronósticos) para benchmark continuo y contraste de alertas
INA — percentilesClimatología serie 52366 días × 99 percentiles (ventana ±15 días) Contexto histórico del nivel actual ("percentil de la época") en el dashboard

¿Por qué San Fernando como estación de cabecera?

De las tres estaciones del río Luján con historia pública, San Fernando es la única con serie horaria profunda (2011→hoy); Tigre y Dique Luján miden un punto por día. Y el fenómeno a predecir vive en escala horaria: la marea principal (M2) cicla cada ~12,4 h y una sudestada arma su pico en horas — con datos diarios no puede resolverse el análisis armónico, ni entrenarse un pronóstico a +6 h, ni emitirse una alerta con hora. Además, San Fernando está en la desembocadura: es el punto donde marea y sudestada — el 77% de la señal — entran primero. Tigre y Dique Luján quedan reservadas para la etapa siguiente: calibrar el corrimiento (offset y desfasaje) que traduce el pronóstico de San Fernando a los niveles aguas arriba.

Los umbrales mostrados (alerta 2,5 m) son umbrales de referencia propios de este servicio para la escala San Fernando, fijados a partir del comportamiento histórico de la propia serie — no son umbrales oficiales. Los niveles oficiales de la escala de Tigre, aguas arriba, son 3,30 m (alerta) y 3,80 m (evacuación).

3. Marea astronómica

Análisis armónico clásico (método de mínimos cuadrados, con corrección nodal y tendencia) sobre el tramo horario 2011→hoy de San Fernando: 68 constituyentes resueltos. Los coeficientes permiten reconstruir la marea teórica de cualquier fecha, pasada o futura. El residuo (observado − marea) es la variable que modela la etapa siguiente.

4. Modelo del residuo meteorológico

Un modelo de gradient boosting (árboles de decisión potenciados) por cada horizonte de pronóstico: +6, +12, +24 y +30 horas. La curva horaria del dashboard interpola entre esas anclas sobre la marea astronómica. Predictores:

Escenario de alerta (P85)

El servicio publica dos curvas de pronóstico, ambas propias, salidas del mismo sistema con los mismos insumos pero con objetivos distintos:

Para decidir alertas el número correcto es el P85, no el esperado: en inundación importa el caso razonablemente malo, no el promedio. Si la banda P85 cruza el umbral, corresponde avisar aunque el valor esperado quede debajo — aceptando por diseño una cuota de avisos de más. Se muestra como curva punteada en el dashboard; a +6 h detecta por sí sola el 90% de las sudestadas ≥2,5 m sin margen adicional. El pronóstico oficial del INA (sección 2) es un tercer número, independiente de estas dos curvas, que este servicio archiva para contraste.

Corrección de sesgo al publicar (post-proceso)

Antes de publicar cada corrida, el sistema aplica una corrección de sesgo rodante por horizonte, calculada sobre su propio archivo de operación (sección 5): compara, en una ventana móvil de hasta 14 días, el pronóstico crudo contra lo que efectivamente midió el INA, y le resta a cada horizonte su sesgo medido. Dos reglas acotan el ajuste:

Es un ajuste de salida — no reentrena el modelo. Con el centro corregido, la banda P85 se re-centra y recalibra sobre la misma ventana. Para que el ajuste sea auditable, el archivo guarda siempre el pronóstico crudo además del publicado (disponible para auditoría a pedido), y el resumen del método, la ventana y el sesgo restado por horizonte se exponen en el propio pronóstico (meta.last_correction). Requisitos de muestra mínima por horizonte activan la corrección: con archivo insuficiente el pronóstico se publica sin ajustar antes que extrapolar.

5. Validación (backtest con split temporal)

Entrenamiento con datos 2011-2021; evaluación sobre 2022→agosto 2026, datos que el modelo nunca vio. Baseline de comparación: persistencia (asumir que el residuo no cambia).

HorizonteError medio (MAE)Mejora vs. persistencia (RMSE) Detección sudestadas ≥2,5 m*
+6 h17 cm~31%91%
+12 h20 cm~46%83%
+24 h22 cm~55%72%
+30 h22 cm~56%68%

* 65-67 eventos en el período de test según horizonte; disparo de alerta con margen operativo de 25 cm bajo el umbral, acierto si el disparo cae en ±6 h del evento. La tasa de falsas alarmas asociada (45-52%) es el tradeoff elegido: para alerta temprana de inundación se prefiere avisar de más.

Caso de referencia: la sudestada récord del 18-19 de diciembre de 2023 (3,60 m observados, máximo de toda la serie). En la ventana de ±6 h del pico, el pronóstico a 6 h marcaba hasta 3,47 m y el escenario P85 ~3,6 m: alerta clara. El modelo operativo nunca vio ese evento en entrenamiento (se entrena hasta 2021) y lo detectó igual.

Eventos en operación (bitácora)

Los eventos reales que el sistema atravesó desde su puesta en operación, con lo que pronosticó y lo que pasó — incluidas las fallas:

Validación operativa continua (en vivo)

El backtest mide el pasado; esta tabla mide la operación real. Cada corrida emitida queda archivada en el momento de su emisión — no puede corregirse después — junto con las observaciones del INA. La tabla se recalcula automáticamente sobre ese archivo a medida que entran nuevas corridas y observaciones (se sirve con un cache breve; el momento del último cálculo figura al pie): incluye todas las corridas desde la puesta en operación y no admite selección de casos. Criterio: error = pronóstico − observado (la observación horaria del INA se promedia a la hora en punto más cercana); bias positivo = pronóstico por encima de lo observado; cobertura P85 = fracción de observaciones que quedaron por debajo de la banda de alerta (valor nominal de diseño: 85%). Como referencia se aplica el mismo criterio al pronóstico oficial del INA para San Fernando (sección 2), que este servicio archiva corrida por corrida.

Calculando sobre el archivo…

Nota de lectura: este servicio y el INA se evalúan cada uno sobre sus propias emisiones (muestras no apareadas — el INA emite ~1 vez/día, este servicio cada 3 h). Además, n cuenta horas evaluadas, no muestras independientes: las horas de una misma corrida están correlacionadas entre sí, y el tamaño efectivo de muestra es del orden del número de corridas.

El track-record en vivo es corto (el servicio entró en operación en septiembre de 2026): las métricas de esta tabla son provisorias hasta acumular cientos de corridas y varios eventos, y deben leerse como tendencia, no como cobertura garantizada. El backtest de arriba, sobre cuatro años de datos no vistos, es la medida robusta.

6. Operación

7. Limitaciones conocidas

Este es un servicio experimental (PoC) y no reemplaza a los sistemas oficiales. Para alertas oficiales consultar el INA, el SHN y Defensa Civil.