Publicamos nuestro error, la muestra y los límites para que puedas juzgarlo.
Dos evidencias distintas
Backtest histórico
Las tablas de esta página reconstruyen predicciones pasadas y las comparan con el reanálisis ERA5. Sirven para comprobar el algoritmo, pero no son el historial de lo que vio una persona en Isobaria.
Resultados reales en producción
Aún no publicamos resultados de producción: faltan observaciones independientes archivadas y contrastadas. Conservamos cada salida publicada para poder medirla sin reconstruirla después.
No presentaremos validación en producción hasta que existan esos registros y su comparación con observaciones. Un backtest que sale bien no sustituye esa prueba.
El ETA del radar se mide aparte
Cada ETA se archiva al emitirse y se contrasta después con fotogramas de radar posteriores. No reconstruimos predicciones antiguas ni usamos ese pasado para afirmar que el radar acierta.
Muestra prospectiva reciente
836 ETAs resueltos con observación posterior
Dentro del margen emitido
26,1 %
Cobertura observada
84,0 %
Error mediano al llegar
7 min
516 ETAs no tuvieron llegada observada y cuentan como fallo. 159 no se puntuaron por falta de cobertura del radar.
≤−20 min: 46
−19…−11 min: 56
−10…−1 min: 140
0…10 min: 78
11…19 min: 0
≥20 min: 0
Lo que importa: ¿sirve de algo nuestro índice de acuerdo entre modelos?
Isobaria no dice solo qué tiempo hará: dice cuánto acuerdo hay entre los modelos. Esa medida se puede comprobar, y tiene que cumplir una cosa muy concreta: cuando decimos que los modelos coinciden, deberíamos equivocarnos menos.
Cuando decimos…
…cuánto nos equivocamos, y sobre cuántas horas
NivelError medioHoras medidas
Acuerdo alto85/100 o más — los modelos coinciden
1,40 °C
163.518 h
Acuerdo medio60–84/100 — hay matices
1,81 °C
1.057.264 h
Acuerdo bajo35–59/100 — los modelos discrepan
2,52 °C
958.030 h
Acuerdo muy bajomenos de 35/100 — el detalle horario puede cambiar
3,29 °C
273.988 h
Se cumple. El error crece de forma sostenida a medida que baja el acuerdo: cuando decimos que los modelos coinciden nos equivocamos casi la mitad que cuando decimos que no. El índice no es un adorno — ordena.
Si esta tabla dejara de ordenar, el índice no valdría nada y habría que rehacer el algoritmo. Está escrito así en nuestra documentación desde antes de poder medirlo, y esta página publicaría igualmente el fallo.
Cuánto se equivoca cada modelo
Isobaria combina tres modelos y los pesa por lo bien que aciertan. Estos son los errores con los que se calculan esos pesos, por cuántos días vista.
Temperatura
El error medio en grados: cuánto nos separamos de lo que hizo.
Error de cada modelo en temperatura, por horizonte de predicción.
Dentro de
ECMWF
ICON
GFS
1 día
0,95 °C
1,10 °C
1,29 °C
2 días
1,03 °C
1,18 °C
1,35 °C
3 días
1,13 °C
1,28 °C
1,44 °C
4 días
1,27 °C
1,45 °C
1,57 °C
5 días
1,45 °C
1,75 °C
1,73 °C
6 días
1,75 °C
1,95 °C
1,91 °C
7 días
1,98 °C
—
2,13 °C
Se lee solo: los tres empeoran con el alcance, y a siete días vista el mejor se equivoca el doble que a un día. Eso no es un defecto — es lo que hay, y es exactamente el motivo por el que la confianza de un séptimo día no puede pintarse igual que la de mañana.
Lluvia
Aquí no vale el error medio: acertar «no llueve» todos los días de julio daría un diez sin haber predicho nada. Se mide con el CSICritical Success Index, o índice crítico de acierto., que solo cuenta las horas en que alguien dijo que llovía o llovió: aciertos entre aciertos más fallos más falsas alarmas. Cuanto más alto, mejor.
Error de cada modelo en lluvia, por horizonte de predicción.
Dentro de
ECMWF
ICON
GFS
1 día
50,1 %
39,9 %
40,9 %
2 días
46,2 %
36,3 %
37,1 %
3 días
41,6 %
31,7 %
32,9 %
4 días
36,1 %
30,4 %
28,2 %
5 días
31,9 %
24,5 %
23,3 %
6 días
29,1 %
20,3 %
18,4 %
7 días
24,8 %
—
15,3 %
La lluvia no se acierta igual todo el año. Medido por separado, a un día vista el mejor modelo acierta un 54 % en invierno y un 30 % en verano: la lluvia de frente se coloca bien y la tormenta de julio no. Estas cifras son la media de los doce meses, así que en invierno somos mejores de lo que dicen y en verano, peores.
Viento
Error medio en kilómetros por hora, igual que la temperatura.
Error de cada modelo en viento, por horizonte de predicción.
Dentro de
ECMWF
ICON
GFS
1 día
2,74 km/h
3,35 km/h
4,58 km/h
2 días
2,94 km/h
3,51 km/h
4,73 km/h
3 días
3,19 km/h
3,72 km/h
4,90 km/h
4 días
3,55 km/h
3,99 km/h
5,13 km/h
5 días
3,89 km/h
4,29 km/h
5,44 km/h
6 días
4,36 km/h
4,68 km/h
5,75 km/h
7 días
4,73 km/h
—
6,04 km/h
El viento es donde más se separan los tres: a un día vista, el peor se equivoca casi el doble que el mejor. Es la variable en la que pesar por habilidad compra más.
Cómo se ha medido
Periodo
Del al .
Dónde
20 puntos repartidos por España, elegidos para cubrir climas distintos —atlántico, mediterráneo, continental, montaña y Canarias— y no para que salgan buenos números.
Contra qué
Reanálisis ERA5 (ERA5 (Open-Meteo Archive API)), no observaciones de estación.
Qué se compara
Lo que cada modelo predijo 1, 2… 7 días antes de cada hora, frente al reanálisis ERA5 de esa hora.
Lo que esta medición no demuestra
Una página de verificación que solo presume no es una verificación. Cuatro límites, y son reales:
La referencia no es una estación, es un reanálisis
ERA5 es un reanálisis: un modelo que asimila observaciones, no un termómetro de estación. Y lo produce el ECMWF: su propio modelo parte con ventaja al compararse contra él. Por eso ECMWF gana todas las filas de la tabla de arriba, y por eso hay que leerlo con reservas. Ya publicamos una primera muestra de estaciones de AEMET, pero no cambia los pesos ni valida producción: exige más estaciones y meses de observación.
Un acuerdo alto no significa que vayamos a acertar
El índice mide cuánto coinciden los modelos entre sí, no la probabilidad de acertar. Pueden coincidir y equivocarse todos en el mismo sentido, y a veces pasa: incluso con el acuerdo más alto, el error medio no es cero.
Un año no son todos los años
Estas cifras cubren doce meses seguidos, así que llevan dentro un invierno y un verano. Pero un año concreto tiene los temporales que tiene: una temporada atlántica floja o un otoño sin gota fría cambian estos números sin que ningún modelo haya cambiado. Se repite la medición, y las cifras se moverán.
La habilidad cambia con la estación, y aquí va promediada
Medido por separado, los tres modelos aciertan la lluvia mucho mejor en invierno que en verano —a un día vista, un 54 % frente a un 30 %—, y sobre todo se parecen más entre ellos: en invierno ICON y GFS valen casi tanto como ECMWF, y en verano bastante menos. Los pesos de esta página son la media de las dos cosas, así que en enero desconfían de más y en julio, de menos. Calibrar por estación es el siguiente paso.
Medición generada el . Las cifras de esta página se leen del mismo fichero del que el motor saca sus pesos: no están escritas a mano.