Metodología
Este servicio pronostica la altura hidrométrica del río Luján en San Fernando (escala del INA, serie 52) para las próximas 30 horas, combinando la marea astronómica con un modelo estadístico del efecto meteorológico, entrenado sobre la serie horaria 2011-2021 y validado sobre 2022-2026 — 15 años de mediciones en total.
Este sistema forma parte de la plataforma Copernicus, distinguida con el 1er Premio CarpinchIA 2026 de la Universidad Nacional del Delta.
1. El enfoque: descomponer la señal
La altura del río en la zona del bajo Luján / Delta es la suma de dos componentes de naturaleza muy distinta:
- Marea astronómica — periódica y predecible a cualquier fecha futura. En San Fernando explica solo ~23% de la varianza del nivel (régimen micromareal mixto, constituyente principal M2 con amplitud ~0,25 m).
- Residuo meteorológico — el ~77% restante: la sobre-elevación por viento sudeste sostenido sobre el Río de la Plata (sudestada), el aporte de la cuenca por lluvia, y el estado de fondo del estuario. Es lo que una tabla de mareas no puede dar, y es lo que este modelo predice.
El pronóstico publicado es: marea astronómica (calculada) + residuo (modelado).
2. Datos utilizados
En síntesis: el agua sale del INA (alturas observadas, en histórico y en vivo); el cielo sale de ERA5 para el pasado (entrenamiento) y de Open-Meteo para el futuro (operación), sobre los mismos 6 puntos geográficos; la marea la calculamos nosotros a partir de la propia serie (sección 3). El detalle:
| Fuente | Serie | Frecuencia y rango | Rol |
|---|---|---|---|
| INA — red de alerta | San Fernando (serie 52) | Horaria, 2011→hoy (diaria 2006-2010) | Variable objetivo; ~128.000 observaciones. El modelo y el análisis de marea usan solo el tramo horario 2011→hoy (~15 años): el tramo diario inicial no resuelve la escala horaria del fenómeno |
| INA | Tigre (49) y Dique Luján (50) | Diaria, 2006→hoy | Contexto y mapeo de niveles aguas arriba |
| INA | Paraná en Rosario (serie 34) | Diaria, histórica→hoy | Proxy del caudal del Paraná (estado de fondo del estuario) — en entrenamiento y en operación |
| ERA5 (Copernicus/ECMWF) | Viento 10 m (u,v), presión a nivel del mar y precipitación | Horaria, 2006→2026 | Meteorología histórica para entrenamiento: 3 puntos sobre el estuario — frente a San Fernando, estuario medio y Río de la Plata exterior (el punto aguas afuera anticipa la onda de sudestada: lead time) — más presión en los extremos del eje (gradiente = driver físico de la sobre-elevación) y lluvia en 3 puntos de la cuenca (Mercedes, Luján, Pilar) |
| Open-Meteo | Mismas variables, mismos 6 puntos | Pronóstico a 3 días | Meteorología futura en operación — ensemble de 7 modelos numéricos (ECMWF, GFS, ICON, UKMO, Météo-France, GEM, JMA) promediados por componentes, más 82 miembros perturbados (ECMWF ENS 51 + NOAA GEFS 31) que alimentan la banda de alerta dinámica. En el punto costero (frente a San Fernando) el viento se recalibra por quantile mapping contra la distribución de ERA5 con la que se entrenó: promediar el ensemble suaviza los picos, y esta corrección los devuelve sin alterar el tiempo calmo (ver sección 4) |
| INA — pronóstico oficial | San Fernando (26202) y Luján frente Delta (6066) | ~4 días, corrida ~diaria | Archivado por este servicio (el INA no publica histórico de pronósticos) para benchmark continuo y contraste de alertas |
| INA — percentiles | Climatología serie 52 | 366 días × 99 percentiles (ventana ±15 días) | Contexto histórico del nivel actual ("percentil de la época") en el dashboard |
¿Por qué San Fernando como estación de cabecera?
De las tres estaciones del río Luján con historia pública, San Fernando es la única con serie horaria profunda (2011→hoy); Tigre y Dique Luján miden un punto por día. Y el fenómeno a predecir vive en escala horaria: la marea principal (M2) cicla cada ~12,4 h y una sudestada arma su pico en horas — con datos diarios no puede resolverse el análisis armónico, ni entrenarse un pronóstico a +6 h, ni emitirse una alerta con hora. Además, San Fernando está en la desembocadura: es el punto donde marea y sudestada — el 77% de la señal — entran primero. Tigre y Dique Luján quedan reservadas para la etapa siguiente: calibrar el corrimiento (offset y desfasaje) que traduce el pronóstico de San Fernando a los niveles aguas arriba.
Los umbrales mostrados (alerta 2,5 m) son umbrales de referencia propios de este servicio para la escala San Fernando, fijados a partir del comportamiento histórico de la propia serie — no son umbrales oficiales. Los niveles oficiales de la escala de Tigre, aguas arriba, son 3,30 m (alerta) y 3,80 m (evacuación).
3. Marea astronómica
Análisis armónico clásico (método de mínimos cuadrados, con corrección nodal y tendencia) sobre el tramo horario 2011→hoy de San Fernando: 68 constituyentes resueltos. Los coeficientes permiten reconstruir la marea teórica de cualquier fecha, pasada o futura. El residuo (observado − marea) es la variable que modela la etapa siguiente.
4. Modelo del residuo meteorológico
Un modelo de gradient boosting (árboles de decisión potenciados) por cada horizonte de pronóstico: +6, +12, +24 y +30 horas. La curva horaria del dashboard interpola entre esas anclas sobre la marea astronómica. Predictores:
- Persistencia e inercia: residuo actual y sus valores a −3, −6 y −12 h, más la pendiente de las últimas 6 h.
- Marea futura: conocida por el análisis armónico (interacción marea-sobreelevación).
- Viento del estuario: componente sudeste (la dirección que apila agua contra la costa) promediada en ventanas que terminan en el horizonte, en los 3 puntos del Río de la Plata — incluido el exterior, que ve la onda antes — más las componentes u/v puntuales.
- Presión a nivel del mar: presión local, su variación hacia el horizonte y el gradiente a lo largo del eje del estuario (interior − exterior) — el empuje barométrico que acompaña a la sudestada.
- Lluvia de la cuenca: acumulados de 24, 48 y 72 h en Mercedes, Luján y Pilar — el aporte de la cuenca alta llega con ese retardo.
- Paraná: nivel en Rosario, su media de 30 días y su anomalía de 90 días (estado de fondo: bajante histórica vs. río crecido).
Escenario de alerta (P85)
El servicio publica dos curvas de pronóstico, ambas propias, salidas del mismo sistema con los mismos insumos pero con objetivos distintos:
- Valor esperado — la estimación central: "lo más probable es que el río esté acá". Es la curva principal del dashboard y de la tabla.
- Escenario de alerta (P85) — el techo razonable: el nivel que, dadas las mismas condiciones, solo se supera el ~15% de las veces. Dicho al revés: con 85% de confianza el río no superará este valor. Combina dos fuentes de incertidumbre complementarias: un modelo de regresión por cuantiles por horizonte (el error del sistema con meteorología conocida, aprendido de 15 años), y el spread de 82 miembros perturbados del pronóstico meteorológico — el modelo se corre una vez por miembro y la dispersión de resultados mide cuán predecible está la atmósfera hoy (banda angosta en días estables, ancha cuando el pronóstico es incierto). Ambas se combinan en cuadratura; si los miembros no están disponibles, la banda cae al componente estadístico solo. La banda se publica desde +6 h — el primer horizonte con modelo de cuantil propio; antes de eso rige la curva central.
Para decidir alertas el número correcto es el P85, no el esperado: en inundación importa el caso razonablemente malo, no el promedio. Si la banda P85 cruza el umbral, corresponde avisar aunque el valor esperado quede debajo — aceptando por diseño una cuota de avisos de más. Se muestra como curva punteada en el dashboard; a +6 h detecta por sí sola el 90% de las sudestadas ≥2,5 m sin margen adicional. El pronóstico oficial del INA (sección 2) es un tercer número, independiente de estas dos curvas, que este servicio archiva para contraste.
Corrección de sesgo al publicar (post-proceso)
Antes de publicar cada corrida, el sistema aplica una corrección de sesgo rodante por horizonte, calculada sobre su propio archivo de operación (sección 5): compara, en una ventana móvil de hasta 14 días, el pronóstico crudo contra lo que efectivamente midió el INA, y le resta a cada horizonte su sesgo medido. Dos reglas acotan el ajuste:
- La ventana se trunca en el último cambio de configuración del modelo o de sus insumos: el sesgo se estima solo con pares emitidos por la configuración vigente, nunca mezclando eras. Tras cada cambio la corrección vuelve a cero y se reconstruye sola a medida que la configuración nueva acumula archivo.
- Las corridas que pronostican régimen evento (residuo crudo ≥ 0,60 m) se publican sin corregir: medido sobre ~160 episodios del período de validación 2022-2026, el sesgo del sistema cuando pronostica un evento es ≈ 0, y aplicarle la corrección estimada en régimen calmo lo empeoraría — la lección del evento del 12/09/2026 (sección 5, bitácora).
Es un ajuste de salida — no reentrena el modelo. Con el centro corregido, la
banda P85 se re-centra y recalibra sobre la misma ventana. Para que el ajuste sea
auditable, el archivo guarda siempre el pronóstico crudo además del publicado
(disponible para auditoría a pedido), y el resumen del método, la ventana y el sesgo
restado por horizonte se exponen en el propio pronóstico (meta.last_correction).
Requisitos de muestra mínima por horizonte activan la corrección: con archivo insuficiente
el pronóstico se publica sin ajustar antes que extrapolar.
5. Validación (backtest con split temporal)
Entrenamiento con datos 2011-2021; evaluación sobre 2022→agosto 2026, datos que el modelo nunca vio. Baseline de comparación: persistencia (asumir que el residuo no cambia).
| Horizonte | Error medio (MAE) | Mejora vs. persistencia (RMSE) | Detección sudestadas ≥2,5 m* |
|---|---|---|---|
| +6 h | 17 cm | ~31% | 91% |
| +12 h | 20 cm | ~46% | 83% |
| +24 h | 22 cm | ~55% | 72% |
| +30 h | 22 cm | ~56% | 68% |
* 65-67 eventos en el período de test según horizonte; disparo de alerta con margen operativo de 25 cm bajo el umbral, acierto si el disparo cae en ±6 h del evento. La tasa de falsas alarmas asociada (45-52%) es el tradeoff elegido: para alerta temprana de inundación se prefiere avisar de más.
Caso de referencia: la sudestada récord del 18-19 de diciembre de 2023 (3,60 m observados, máximo de toda la serie). En la ventana de ±6 h del pico, el pronóstico a 6 h marcaba hasta 3,47 m y el escenario P85 ~3,6 m: alerta clara. El modelo operativo nunca vio ese evento en entrenamiento (se entrena hasta 2021) y lo detectó igual.
Eventos en operación (bitácora)
Los eventos reales que el sistema atravesó desde su puesta en operación, con lo que pronosticó y lo que pasó — incluidas las fallas:
- 06/09/2026 — sudestada, pico observado 2,49 m. Las 8 corridas previas ubicaron el pico entre 2,08 y 2,53 m (sesgo medio −0,18 m: el valor esperado quedó corto, consistente con la limitación de extremos declarada en la sección 7); la mitad de esas corridas marcó escenario P85 ≥ 2,50 m con horas de anticipación. Primera sudestada operativa del servicio.
- 12/09/2026 — sobre-pronóstico (falla). Pico observado 2,29 m; las 10 corridas previas publicaron el pico entre 2,58 y 2,75 m (+0,36 m de sesgo medio): el sistema anticipó un evento de alerta que no llegó al umbral. El análisis forense posterior descompuso el exceso: transferencia viento→agua del modelo (+0,20 m), recalibración de viento del punto costero (+0,12 m) y post-proceso entonces vigente (+0,07 m). De ese análisis salió la regla de régimen evento de la sección 4, en operación desde el 14/09; el ajuste de la recalibración de viento en colas sigue en revisión (sección 7).
Validación operativa continua (en vivo)
El backtest mide el pasado; esta tabla mide la operación real. Cada corrida emitida queda archivada en el momento de su emisión — no puede corregirse después — junto con las observaciones del INA. La tabla se recalcula automáticamente sobre ese archivo a medida que entran nuevas corridas y observaciones (se sirve con un cache breve; el momento del último cálculo figura al pie): incluye todas las corridas desde la puesta en operación y no admite selección de casos. Criterio: error = pronóstico − observado (la observación horaria del INA se promedia a la hora en punto más cercana); bias positivo = pronóstico por encima de lo observado; cobertura P85 = fracción de observaciones que quedaron por debajo de la banda de alerta (valor nominal de diseño: 85%). Como referencia se aplica el mismo criterio al pronóstico oficial del INA para San Fernando (sección 2), que este servicio archiva corrida por corrida.
Calculando sobre el archivo…
Nota de lectura: este servicio y el INA se evalúan cada uno sobre sus propias emisiones (muestras no apareadas — el INA emite ~1 vez/día, este servicio cada 3 h). Además, n cuenta horas evaluadas, no muestras independientes: las horas de una misma corrida están correlacionadas entre sí, y el tamaño efectivo de muestra es del orden del número de corridas.
El track-record en vivo es corto (el servicio entró en operación en septiembre de 2026): las métricas de esta tabla son provisorias hasta acumular cientos de corridas y varios eventos, y deben leerse como tendencia, no como cobertura garantizada. El backtest de arriba, sobre cuatro años de datos no vistos, es la medida robusta.
6. Operación
- Las observaciones del INA se sincronizan cada hora.
- El pronóstico se regenera cada 3 horas con la meteorología pronosticada (ensemble de 7 modelos, sección 2); cada emisión cubre 30 h desde la última observación disponible.
- Cada corrida del pronóstico oficial del INA se archiva al llegar, para el benchmark continuo contra este modelo.
- Si el ciclo de regeneración se demora, el sitio sigue sirviendo el último pronóstico emitido, con su fecha de emisión visible al pie del dashboard.
7. Limitaciones conocidas
- El error meteorológico se suma. Las métricas del backtest usan meteorología observada (ERA5); en operación el viento y la lluvia futuros vienen de pronósticos numéricos con error propio. Los números de la tabla son el techo de precisión, no una promesa operativa. Se mitiga —no se elimina— con el ensemble de 7 modelos (sección 2), y la incertidumbre restante no se esconde: los 82 miembros perturbados la miden cada día y el escenario P85 la traduce en banda de alerta.
- Eventos extremos, en el valor esperado. El modelo central es de árboles potenciados, que por construcción no extrapolan por encima del máximo visto en entrenamiento: en la cola (crecidas ≥3,0 m) el valor esperado tiende a quedar corto —hasta ~0,5 m en el backtest de febrero-marzo 2024—. Por eso la decisión de alerta se toma sobre el escenario P85, no sobre el valor esperado: en el evento récord de diciembre 2023 el P85 (~3,6 m) marcó el nivel real mientras el central quedaba en 3,47 m.
- Recalibración de viento en colas, en revisión. La recalibración por quantile mapping del punto costero (sección 2) devuelve los picos que el promedio del ensemble suaviza — pero la evidencia del evento del 12/09/2026 (sección 5, bitácora) muestra que en eventos puede sobre-corregir: aportó +0,12 m del exceso publicado. Está en revisión una variante con la cola acotada; mientras tanto, la regla de régimen evento del post-proceso (sección 4) elimina el componente que sí dependía de esta etapa.
- Latencia de datos. El dato del INA llega con demora variable; el horizonte útil visible oscila entre ~24 y 30 h según el momento del ciclo.
- Punto único. El pronóstico es para la escala de San Fernando; los niveles aguas arriba (Tigre, Dique Luján) difieren en offset y desfasaje.