Cómo evaluar un modelo de pronóstico con IA

Para evaluar un modelo de pronóstico con IA, empieza congelando todo lo que define el pronóstico: la pregunta exacta, la regla de resolución, la marca de tiempo, la versión del modelo, las instrucciones y las fuentes disponibles en ese momento.

En esta guía

Congela las entradas y el momento del pronóstico

Excluye cualquier información posterior, incluidas las respuestas que el propio evento pueda revelar más adelante. Este protocolo reproducible permite que otra persona reconstruya qué sabía el modelo cuando emitió su probabilidad, sin añadir datos que solo se conocieron después.

Ese congelado no es un detalle burocrático. Si cambias las fuentes o la versión del modelo entre preguntas, dejas de comparar pronósticos y empiezas a comparar configuraciones distintas. La política editorial de este sitio describe este flujo como un método propuesto, no como un experimento ya realizado ni como una estrategia rentable establecida.

Usa el mismo conjunto de prueba y documenta lo que falta

Evalúa el modelo y una referencia sobre las mismas preguntas resueltas y el mismo horizonte. Documenta los pronósticos ausentes y las reglas de selección, sin retirar en silencio los casos difíciles que fallaron. Si un modelo no emitió pronóstico para ciertas preguntas, esa ausencia es un resultado relevante y debe aparecer en el informe, no desaparecer de la muestra. La comparación entre modelos y referencias solo es informativa cuando comparten preguntas, fechas y horizonte.

Después de fijar esa base común, puedes examinar qué haría un pronóstico constante. Por ejemplo, un pronóstico fijo de 0,5 obtiene una puntuación Brier de 0,25 en cualquier resultado binario, mientras que un pronóstico de 0,8 obtiene 0,04 si el resultado es 1 y 0,64 si es 0. Esos números no convierten 0,25 en un umbral universal ni demuestran calibración por sí solos, pero sirven como referencia aritmética para interpretar el error de cada pregunta.

Un pronóstico del 80%Ejemplo ficticio
Probabilidad estimada80%
0%100%
Cambia el resultado observado
Error cuadrático0,04(0,8 − 1)²

Este error corresponde a 1 pronóstico. La precisión de un modelo se mide con una muestra de resultados.

Mide con Brier, calibración e incertidumbre por separado

La puntuación Brier binaria es la media de (p−y)², donde p está entre 0 y 1 y el resultado resuelto y es 0 o 1. En esta convención sin escalar, va de 0 a 1, y menos es mejor. La calculadora de Brier puede darte el número, pero ese único valor no establece calibración, habilidad en otra muestra ni rentabilidad de trading. Por eso conviene calcular Brier, examinar calibración, tamaño de muestra, incertidumbre y costes por separado, y luego reunirlos en una lectura conjunta.

La literatura sobre reglas de puntuación descompone estas medidas en fiabilidad y resolución, lo que ayuda a ver si un modelo distingue casos y si sus probabilidades coinciden con las frecuencias observadas. La misma fuente no respalda resultados empíricos en mercados de predicción, clasificaciones de modelos de lenguaje ni rentabilidad de trading. Para incorporar costes y retorno esperado sin confundirlos con precisión, revisa el concepto de valor esperado por separado.

Redacta el informe con exclusiones y límites

Un informe práctico incluye la pregunta congelada, la regla de resolución, la marca de tiempo, la versión del modelo, las instrucciones, las fuentes entonces disponibles y los pronósticos con sus resultados. Añade la lista de exclusiones y predicciones ausentes, el tamaño de muestra, la puntuación Brier y un apartado de calibración e incertidumbre. Si sigues este protocolo, describe lo que hiciste como un flujo propuesto y no como un experimento ya medido ni como una clasificación de modelos.

Mantén visibles los límites. La puntuación Brier no demuestra habilidad en otra muestra, y una explicación segura del modelo no demuestra precisión. Tampoco la evaluación por sí sola confirma rentabilidad después de costes. Presentar estos límites junto a los números evita que un lector confunda una medida de error con una garantía de resultados.

Fuentes y verificación

Redacción PolyZeno. Revisión automatizada con DeepSeek V4.1 Flash.