Tu historial de pronósticos
El registro permanece en tu navegador. El almacenamiento local es opcional. Exporta el CSV para conservar una copia.
La importación sustituye los pronósticos mostrados. Expórtalos antes si quieres conservarlos.
Ejemplo ficticio: 2 pronósticos resueltos y 1 pendiente. Una muestra pequeña no valida un método.
Añade un pronóstico o importa un CSV.
| Intervalo | Pronóstico medio | Frecuencia observada | Cantidad |
|---|
Un registro fechado, no un recuerdo
Un diario de pronósticos es una lista fechada de preguntas binarias con la probabilidad entre 0 y 1 que asignaste antes de saber el resultado. No sirve para demostrar que aciertas, sino para comparar de forma reproducible lo que creías con lo que ocurrió después. Metaculus funciona con pronósticos probabilísticos agregados y criterios de resolución objetivos, no con compra de participaciones; su FAQ indica que algunos torneos llevan premios y que las series de preguntas no necesariamente los llevan, así que no conviene asumir una recompensa universal ni una única forma de puntuar.
El ejemplo que desarrollo aquí es un protocolo ilustrativo diseñado por el autor, no un estudio empírico: un diario que vive solo en tu dispositivo, sin red, sin cuentas y sin sincronización. Si quieres profundizar en la idea de comparar probabilidad declarada con frecuencia observada, puedes consultar la guía de calibración. Si lo que te interesa es la puntuación numérica, la guía del score de Brier cubre la fórmula y sus variantes. Y si tu objetivo es evaluar una regla de decisión sobre datos pasados, la guía de backtest trata ese problema, que es distinto del que resuelve este diario. La guía de IA puede ayudarte si planeas usar un modelo para formularte preguntas o revisar sesgos, pero no sustituye el registro manual.
Formato CSV y reglas de validación
El contrato del ejemplo es simple: 6 columnas en este orden exacto, id, question, forecast_at, probability, outcome, resolved_at. La probabilidad es un número entre 0 y 1. Las marcas de tiempo van en UTC con el formato YYYY-MM-DDTHH:mm:ssZ. Una pregunta pendiente deja outcome y resolved_at en blanco; una pregunta resuelta lleva outcome 0 o 1 y un resolved_at estrictamente posterior a forecast_at. No se admiten fechas futuras. Los identificadores deben ser únicos. El límite del ejemplo es de 2000 registros o 1 MB.
La importación falla de forma atómica: si el CSV está mal formado, si hay IDs duplicados o si alguna fecha viola el orden, no se guarda una parte y se descartan las demás, sino que no entra nada. La exportación neutraliza fórmulas de hoja de cálculo para que un campo de texto no se ejecute al abrirlo.
Cómo se calcula el Brier en tu registro
El score de Brier para una pregunta binaria es (probabilidad menos resultado) al cuadrado. En el ejemplo, 0,7 con resultado 1 da 0,09, y 0,2 con resultado 0 da 0,04. La media de esas 2 preguntas es (0,09 + 0,04) / 2 = 0,065. Cuanto más bajo, mejor, pero un promedio pequeño con pocas preguntas no demuestra habilidad: depende de cuántas preguntas tengas y de lo difíciles que sean.
Las métricas usan solo filas resueltas, porque sin resultado confirmado no hay error que medir. Excluir lo pendiente no es una trampa: es reconocer que el resultado aún no existe. Si una pregunta queda sin resolver para siempre, se queda fuera de la cuenta en lugar de penalizar o premiar al azar.
Calibración por rangos: qué dice y qué no
La calibración agrupa tus pronósticos en rangos de probabilidad y compara la frecuencia observada con el promedio declarado en cada rango. Si en el rango 0,6 a 0,8 tu media fue 0,7 y ocurrió el 70 por ciento de las veces, ese rango está bien calibrado. El ejemplo muestra todos los rangos con datos, incluso los que tienen pocos casos, sin inventar umbrales mínimos.
Un rango con 2 o 3 casos no valida nada. Puede orientarte, pero un exceso de confianza sostenido solo se ve con muchos pronósticos y con preguntas variadas. La calibración mide correspondencia entre lo que dijiste y lo que pasó, no rentabilidad: puedes estar bien calibrado y aun así perder por comisiones, por liquidez o por elegir mercados con poca ventaja.
Ejemplo trabajado con 2 pronósticos
Registra la pregunta A con forecast_at 2026-01-01, probability 0,7, resolved_at 2026-02-01 y outcome 1. Su Brier es (0,7 − 1)² = 0,09. Registra la pregunta B con probability 0,2, resolved_at 2026-02-02 y outcome 0. Su Brier es (0,2 − 0)² = 0,04. La media es (0,09 + 0,04) / 2 = 0,065.
Cambia el escenario. Si hubieras dicho 0,9 para A y 0,1 para B con los mismos resultados, los Brier serían 0,01 y 0,01, media 0,01: acertar con más confianza baja el score. Si inviertes los resultados, 0,7 con 0 y 0,2 con 1, obtienes 0,49 y 0,64, media 0,565: la misma confianza falla mucho más. Ese contraste te ayuda a decidir si tu exceso de confianza es sistemático o puntual.
| id | question | forecast_at | probability | outcome | resolved_at | brier |
|---|---|---|---|---|---|---|
| A | ¿Ocurrirá el evento X? | 2026-01-01T00:00:00Z | 0.7 | 1 | 2026-02-01T00:00:00Z | 0.09 |
| B | ¿Ocurrirá el evento Y? | 2026-01-01T00:00:00Z | 0.2 | 0 | 2026-02-02T00:00:00Z | 0.04 |
Persistencia local: control y coste
El diario puede guardarse solo en el dispositivo con consentimiento explícito, y ofrece exportar y borrar. No hay red, ni sincronización, ni cuenta. Esa decisión reduce exposición, pero también significa que si borras los datos o cambias de dispositivo sin exportar, pierdes el registro. No es una recomendación de privacidad universal, sino una elección de diseño para quien quiera control local.
Cuándo te sirve y cuándo no
Úsalo si quieres una contabilidad reproducible de tus probabilidades antes del resultado, con un CSV legible y sin dependencias de red. No lo uses como backtest de una estrategia de mercado ni como prueba de rentabilidad. Tampoco lo uses para comparar contra resultados electorales actuales si no tienes criterios de resolución objetivos y datos verificables. La FAQ de Metaculus subraya que la resolución objetiva forma parte del diseño de las preguntas; sin ella, el outcome es ambiguo y la métrica pierde sentido.
La decisión práctica es esta: si vas a medir tu calibración, necesitas muchas preguntas resueltas y bien definidas; si solo quieres registrar unas pocas, el diario te dará una foto útil, no una conclusión. Si buscas evaluar una regla de trading, este instrumento no es el adecuado: el Brier mide error probabilístico, no resultado económico.
| Objetivo | Usar diario CSV | No usar diario CSV |
|---|---|---|
| Registrar probabilidad antes del resultado | Sí, con id, question, forecast_at, probability, outcome, resolved_at | No si no puedes fechar el pronóstico |
| Calcular Brier medio | Sí, solo con filas resueltas | No con resultados ambiguos |
| Validar rentabilidad | No, el diario no mide comisiones ni liquidez | No como prueba de ganancias |
| Comparar con elecciones actuales | No sin criterios objetivos y datos verificables | No como validación empírica |
Fuentes y verificación
Fuentes consultadas
Redacción PolyZeno. Revisión automatizada con DeepSeek V4.1 Flash.