Calibración de pronósticos: comparar probabilidades y resultados
Cómo comprobar si tus probabilidades coinciden con los resultados reales: calibración, agudeza, un ejemplo con 10 casos y el Brier, sin inferir rentabilidad.
En esta guía
Qué estás comparando realmente
Un pronóstico probabilístico asigna un número entre 0 y 1 a un evento futuro. Calibrar consiste en comprobar si ese número coincide con la frecuencia observada cuando agrupas pronósticos parecidos. Si registras 10 pronósticos del 70% y en 7 ocurre el evento, la frecuencia observada es 0,7, igual que la media de tus pronósticos. Esa coincidencia es lo que buscas al calibrar, pero no demuestra que tu modelo sea bueno: solo indica que, dentro de ese grupo, los números no estaban sesgados.
Conviene separar 2 cosas que suelen mezclarse. La calibración mide la correspondencia entre probabilidad y frecuencia. La agudeza mide cuánto te alejas del 50% cuando tienes información. Un pronóstico anclado siempre en 0,5 es poco agudo y puede estar mal calibrado si el evento ocurre casi siempre. Un conjunto muy agudo también puede estar mal calibrado si sobreestima de forma sistemática. Necesitas las 2 dimensiones y un tamaño de muestra suficiente antes de sacar conclusiones.
Ejemplo ilustrativo: 10 pronósticos del 70% y 7 aciertos
Esto es un ejemplo construido para explicar el método, no un estudio empírico. Supón 10 predicciones independientes, cada una con probabilidad 0,7 de ocurrir, y se observan 7 casos SÍ. La media de los pronósticos es 0,7 y la frecuencia observada es 7/10 = 0,7. En ese grupo la calibración bruta parece perfecta. El problema es que con solo 10 casos la varianza de una proporción es alta: la coincidencia puede aparecer por azar y no deberías concluir estabilidad a partir de un único grupo pequeño.
Una métrica complementaria es la puntuación de Brier, que es el error cuadrático medio entre probabilidad y resultado (0 o 1). Para una predicción de 0,7 que resulta SÍ: (0,7 − 1)² = 0,09. Para una predicción de 0,2 que resulta NO: (0,2 − 0)² = 0,04. Si solo tienes esos 2 casos, la media es (0,09 + 0,04) / 2 = 0,065. Un Brier más bajo es mejor, pero no implica rentabilidad ni acierto económico.
| Entrada | Valor | Cálculo | Resultado |
|---|---|---|---|
| Número de pronósticos | 10 | n = 10 | 10 |
| Probabilidad de cada pronóstico | 0,7 | media = (10 × 0,7) / 10 | 0,7 |
| Casos SÍ observados | 7 | frecuencia = 7 / 10 | 0,7 |
| Brier de un SÍ con p=0,7 | (0,7 − 1)² | error cuadrático | 0,09 |
| Brier de un NO con p=0,2 | (0,2 − 0)² | error cuadrático | 0,04 |
| Brier medio de esos 2 casos | (0,09 + 0,04) / 2 | media aritmética | 0,065 |
Selección de muestra y riesgo de azar
La selección de la muestra importa tanto como el cálculo. Si eliges los grupos donde coinciden probabilidad y frecuencia, inflas artificialmente la calibración. Para evaluar de forma justa debes fijar los grupos antes de ver los resultados, incluir todos los pronósticos dentro del periodo definido y no descartar los que fallan. Un grupo con 10 casos y otro con 1 000 no tienen la misma incertidumbre: el segundo permite una estimación más estable.
Plataformas como Metaculus agregan pronósticos de usuarios en predicciones comunitarias y aplican criterios de resolución objetivos, pero no se compran participaciones de eventos. Algunos torneos tienen premios de rendimiento y las series de preguntas no necesariamente los tienen. Por eso no debes asumir recompensas universales ni una única implementación de puntuación válida para todas las plataformas.
Registrar y revisar sin autoengañarte
Un registro útil guarda fecha, enunciado, probabilidad, fuente de resolución, resultado y notas. Al revisar, agrupa por rangos (por ejemplo 0,6 a 0,8), calcula la frecuencia observada y compara con la media del rango. Repite con distintos cortes de tiempo y con subconjuntos definidos de antemano. Una herramienta de diario está planificada, pero no debe presentarse como disponible hasta que exista un enlace real.
Si tu objetivo es comparar con una referencia de mercado o de modelo, conviene separar probabilidad de retorno a través del valor esperado. Y si te interesa cómo se construyen los pronósticos con modelos o cómo estos pueden asistirte, tienes contexto en inteligencia artificial aplicada a pronósticos, siempre como apoyo y no como sustituto de tu propio registro.
Tabla de decisión
Usa la siguiente tabla como guía condicional. No ordena métodos ni sugiere que uno sea universalmente mejor: cada fila responde a una pregunta distinta y depende del tamaño de muestra y del uso previsto.
| Pregunta | Métrica | Qué indica | Cuándo usarla |
|---|---|---|---|
| ¿Mis números coinciden con las frecuencias? | Calibración | Diferencia entre probabilidad media y frecuencia observada | Cuando agrupas pronósticos similares y tienes muestra suficiente |
| ¿Mis pronósticos son informativos? | Agudeza | Cuánto se alejan del 50% | Cuando quieres saber si aportas información más allá de la incertidumbre base |
| ¿Cuál es el error cuadrático? | Brier | Error medio entre probabilidad y resultado 0/1 | Cuando comparas conjuntos de pronósticos con reglas de resolución claras |
Límites y siguiente decisión
La calibración no mide si ganas dinero, solo si tus probabilidades se alinean con las frecuencias. Un conjunto calibrado puede ser poco agudo y por tanto poco informativo. Tampoco corrige problemas de selección, dependencia entre eventos o cambios de régimen. Con muestras pequeñas, como el ejemplo de 10 casos, la coincidencia puede ser casual y las conclusiones deben ser provisionales.
El siguiente paso es definir de antemano los rangos, el horizonte temporal y las reglas de resolución; luego registrar cada pronóstico y revisar periódicamente calibración y Brier. Si el registro no está definido antes de ver resultados, cualquier métrica que calcules después será difícil de interpretar.
Fuentes y verificación
Fuentes consultadas
Redacción PolyZeno. Revisión automatizada con DeepSeek V4.1 Flash.