Tes prévisions
Scénario illustratif · aucune donnée de marché en direct
Évaluation de l’échantillon
Brier = moyenne((probabilité − résultat observé)²).
Un score plus faible est meilleur. La référence attribue 50% à chaque événement et obtient 0,25. Un petit échantillon illustratif ne démontre ni précision future ni rentabilité.
Saisir des prévisions binaires résolues
Dans le calculateur, saisis une probabilité et un résultat final (0 ou 1) par ligne. Conserve aussi la question, la date et l’horizon dans ton journal de prévisions. Sans résultat connu, la ligne n’entre pas dans le score. Cette convention non mise à l’échelle va de 0 à 1 et plus bas est meilleur ; elle ne doit pas être confondue avec la convention à deux classes allant de 0 à 2.
Pour rendre la comparaison reproductible, gèle la question, la règle de résolution, l’horodatage de la prévision, la version du modèle, les invites et les sources alors disponibles, puis exclus toute information postérieure. Enregistre les prévisions et les résultats observés, compare les modèles et les références sur les mêmes questions et le même horizon, et publie les exclusions et les prévisions manquantes. Le score de Brier binaire se calcule à part, tout comme la calibration, la taille de l’échantillon, l’incertitude et les coûts. Aucun classement de modèles ni résultat d’expérience n’a été mesuré pour ce site.
Formule et exemples avec 0,8
Avec p = 0,8 : si y = 1, le score est (0,8-1)^2 = 0,04 ; si y = 0, il est (0,8-0)^2 = 0,64. Une prévision constante de 0,5 donne 0,25 pour chaque résultat binaire. Le score unique ne prouve ni la calibration, ni une compétence sur un autre échantillon, ni une rentabilité de trading. Ne traite pas 0,25 comme un seuil optimal ou universel de performance.
La littérature sur les règles de score décompose le score de Brier en fiabilité et résolution : cela aide à voir si une probabilité a été fiable et si elle distinguait les cas, plutôt que de lire le score comme un verdict unique. L’article n’apporte ni résultats empiriques de marché de prédiction, ni classement de grands modèles de langage, ni rentabilité de trading.
Ce que la comparaison d’échantillons ne montre pas
Comparer des scores n’a de sens que sur des questions identiques, aux mêmes dates et avec le même horizon, en indiquant la taille et le mode de sélection de l’échantillon. Le score seul ne mesure pas la calibration, ni la performance sur un autre échantillon, ni la rentabilité d’une stratégie. Utilise le calculateur d’espérance pour séparer les coûts et l’espérance de gain des probabilités évaluées.
Sources et vérification
Rédaction PolyZeno. Relecture automatisée avec DeepSeek V4.1 Flash.