Método

Cómo funciona MeteoRanking

seis modelos · un combinado ponderado · verificación contra la estación oficial

Casi todas las webs del tiempo te enseñan un pronóstico. Casi ninguna te enseña cuánto se equivocó ayer. MeteoRanking existe para hacer las dos cosas: combinar los mejores modelos meteorológicos del mundo y, cada día, rendir cuentas comparando lo que dijeron con lo que de verdad ocurrió en tu ciudad. Esta página explica el método completo, con los mismos números que usa el código.

Qué es un modelo meteorológico

Un modelo meteorológico es un programa que divide la atmósfera en una malla tridimensional de celdas y resuelve, celda a celda, las ecuaciones físicas del aire: cómo se mueve, cómo se calienta, cuándo condensa. Partiendo de millones de observaciones (satélites, estaciones, globos sonda, aviones), simula la atmósfera hacia el futuro. Los mantienen los grandes centros meteorológicos del mundo, y ninguno es infalible: cada uno tiene sus manías — uno tiende a exagerar el viento, otro se queda corto con las mínimas — y esas manías cambian según el lugar y la estación.

Los seis que combinamos

MeteoRanking consulta, a través de Open-Meteo (datos bajo licencia CC BY 4.0), seis modelos globales de primer nivel:

  • ECMWF — el modelo IFS del Centro Europeo de Predicción a Plazo Medio, el referente mundial.
  • ICON — el del servicio meteorológico alemán (DWD).
  • Météo-France — el servicio meteorológico francés.
  • UKMO — la Met Office británica (sus datos abiertos se publican bajo licencia CC BY-SA).
  • GEM — el modelo del servicio meteorológico de Canadá.
  • AIFS — el modelo de inteligencia artificial del ECMWF, una arquitectura completamente distinta (no publica rachas de viento).

Hasta el 24 de septiembre de 2026 eran nueve. Ese día retiramos tres: GFS (EE. UU.), JMA (Japón) y CMA (China). No fue por gusto: medido sobre los más de 700 municipios, GFS era el último de la clasificación en cuatro de las ocho variables y JMA casi nunca ganaba en ningún sitio; y al recalcular el combinado sin los tres, acertaba lo mismo que con ellos. Lo que hace bueno a Sinapsis no es cuántos modelos mezcla, sino cómo pesa a cada uno en tu ciudad. Del GFS seguimos tomando una sola cosa, el índice UV, porque es el único modelo que lo publica.

En la tira multimodelo verás además tres modelos regionales de alta resolución — ICON-EU (DWD, ~7 km), ARPEGE-Europa (Météo-France, ~11 km) y AROME (Météo-France, ~1,5 km, Francia y norte de España) — que se muestran para comparar, pero no entran en el ranking puntuado: aún no los verificamos con el mismo rigor, y mezclarlos sería hacer trampa.

El combinado: una media que aprende

Al combinado lo llamamos Sinapsis y lo versionamos: hoy corre Sinapsis 3. Cuando cambie la forma de ponderar o de corregir el sesgo subirá de versión (3.1, 3.5, 4…), y el ranking de cada ciudad dirá siempre qué versión firmó esas cifras.

La línea gruesa, Sinapsis 3, no es un modelo más: es una síntesis ponderada de los seis. La idea es vieja y sólida — los meteorólogos la llaman ensemble — y consiste en que el promedio de varios modelos independientes suele acertar más que cualquiera de ellos por separado. Nosotros damos un paso más: el peso de cada modelo no es fijo. Se recalcula para cada variable que podemos verificar (máxima, mínima, precipitación, viento, racha y humedad) y cada horizonte (mañana, pasado, dentro de tres días…) según su acierto reciente en tu ciudad, dando más importancia a los errores nuevos que a los antiguos, con una semivida de 45 días: el error de hace mes y medio pesa la mitad que el de ayer.

Además corregimos el sesgo medido de cada modelo antes de promediar: si uno lleva semanas quedándose 1 °C corto con las máximas en tu zona, se le suma ese grado. Lo validamos con un backtest de un año en cuatro climas distintos: la corrección mejora la temperatura máxima un 5,6 %, la mínima un 4,7 %, el viento un 7,4 %, las rachas un 13,5 % y la nubosidad un 2 %. La precipitación se excluye a propósito: es asimétrica y casi siempre cero, y corregirle el sesgo la empeora (un 8 %). Cuando un ajuste no funciona, no se aplica — aunque quede menos elegante.

La humedad tampoco se corrige, y conviene decir por qué: aquel backtest midió cinco variables, y esa no estaba. Se puntúa igual que las demás — verás su MAE y su sesgo en el ranking de tu ciudad — pero al combinarla nos limitamos a ponderar. Aplicarles una corrección que nadie ha validado sería exactamente el tipo de atajo que este sitio existe para no dar. El día que repitamos el backtest con ellas dentro, lo contaremos aquí.

La verificación: cada día, contra la realidad

Aquí está el corazón del sitio. Varias veces al día, nuestro servidor recorre los más de 700 municipios de España y Portugal y refresca los pronósticos; cada pocos días, además, puntúa los antiguos de cada municipio. Para puntuar forma pares (predicción, observación): lo que cada modelo dijo ayer para hoy —que guardamos nosotros mismos cada día, en nuestro propio archivo—, frente a lo que de verdad midió la estación oficial más cercana, de AEMET en España y del IPMA en Portugal. De cada par salen dos métricas sencillas: el error medio absoluto (MAE: cuántos grados, milímetros o km/h se desvió, en promedio) y, para la lluvia, el acierto sí/no (¿llovió al menos 0,1 mm cuando dijo que llovería?). En la sección Fiabilidad puedes ver esa verificación día a día: pronóstico de víspera contra observación, fecha a fecha, sin retoques.

Un cambio que preferimos contar nosotros. Hasta el 24 de septiembre de 2026 la vara no era la estación, sino el reanálisis ERA5 del ECMWF: la mejor reconstrucción posible del estado de la atmósfera, pero una reconstrucción sobre una malla de unos 30 km, no un termómetro. Desde ese día medimos contra el termómetro de verdad. Para la temperatura es una vara mejor —la estación mide la máxima y la mínima en continuo, no las estima—, pero es otra vara: las cifras de error cambiaron (de media, la estación marca unas siete décimas más que ERA5, y en algunas ciudades bastante más), y el orden de los modelos puede haber cambiado en algunos sitios. No es que los modelos empeoraran de un día para otro; es que ahora se les examina con otro metro.

El cambio tiene dos renuncias, y las decimos. Las estaciones no miden la nubosidad, y solo una de cada cinco publica la presión al nivel del mar: esas dos variables han dejado de puntuarse. Siguen en el pronóstico, combinando los modelos a partes iguales, pero ya no te podemos decir quién las acierta. Y en Portugal el IPMA publica lecturas horarias, no el máximo continuo, así que allí la máxima diaria se queda algo corta.

El ranking local y el «walk-forward»

Con esos pares construimos la clasificación local: qué modelo acierta más en tu ciudad, variable a variable, agregando los horizontes de 1 a 3 días. Un modelo solo puntúa cuando acumula al menos 10 pares — antes de eso, decir «es el mejor» sería ruido.

Y la fila de Sinapsis 3 en ese ranking tiene una regla especial, la más importante de todo el método: se evalúa fuera de muestra, con la técnica llamada walk-forward. El pronóstico combinado de cada día se puntúa usando únicamente los pesos que existían el día anterior — es decir, exactamente el pronóstico que tú habrías visto esa mañana, no uno recalculado a toro pasado. Sin esta regla, el combinado jugaría con ventaja: se estaría examinando de un examen cuyas respuestas ya conoce. Con ella, compite en igualdad de condiciones con los seis modelos. Es la diferencia entre una nota real y una nota maquillada.

De dónde sale la ventana de días

Cuando el sitio dice «últimos N días», ese número no es una promesa: es una medición. En cada corrida calculamos la edad del par verificado más antiguo disponible y publicamos esa ventana real. Depende de dos archivos nuestros: el de pronósticos, que guardamos cada día desde julio de 2026, y el de observaciones de estación, que conserva 40 días. Podríamos escribir un número más impresionante en un texto fijo; preferimos que la cifra salga de los datos de cada corrida, aunque sea más modesta. Es una ventana suficiente para separar los modelos buenos de los malos en tu zona y lo bastante corta para reflejar su forma actual, que cambia con las estaciones.

La promesa de honestidad

Todo lo anterior se resume en un compromiso: «si un día lo hacemos peor que un modelo, lo verás». El sitio publica, sin filtro, si el combinado bate o no al mejor modelo individual de tu ciudad; la gráfica de evolución muestra el MAE en ventana móvil de 30 días de todos los modelos y del propio combinado, en la misma escala; y la verificación diaria enseña cada fecha en la que nos equivocamos, cuánto, y quién lo hizo mejor. También te contamos las limitaciones antes de que las descubras: las temperaturas mínimas y la lluvia débil son intrínsecamente más difíciles de predecir que las máximas — para los seis modelos y, por tanto, también para nosotros.

No te pedimos que te fíes de MeteoRanking. Te pedimos que mires los datos de ayer y decidas tú. Están en la portada, todos los días.