Calibration des prévisions : confronter probabilités et résultats
Quand tu annonces 70 %, est-ce que ça arrive 70 % du temps ? Tranches de probabilité, score de Brier, taille d'échantillon et pièges de sélection, avec un exemple chiffré.
Dans ce guide
La question que pose vraiment la calibration
La calibration compare 2 choses sur un ensemble de prévisions comparables : la probabilité que tu avais annoncée, et la fréquence à laquelle l'événement s'est réellement produit. Si tu as annoncé 70 % sur 10 questions similaires et que 7 se sont réalisées, ta tranche affiche une moyenne de 0,70 et une fréquence observée de 0,70. Ces 2 nombres proviennent du même exemple fictif et ne constituent aucun résultat d'étude.
Cette mesure ne dit pas si tes probabilités sont « vraies » ni si tu gagnerais de l'argent en pariant dessus. Elle dit seulement si, en moyenne, tes annonces correspondent à ce qui arrive. Sur des plateformes de questions comme Metaculus, les utilisateurs soumettent des probabilités qui contribuent à une prévision agrégée de la communauté, et les questions sont tranchées par des critères de résolution objectifs définis à l'avance. Ce cadre permet de comparer les prévisions sur des questions définies à l'avance.
Calibration et finesse : 2 propriétés distinctes
La finesse, c'est ta propension à t'écarter de 50 % : annoncer 0,9 ou 0,1 est plus fin qu'annoncer 0,5. Un prévisionniste qui répond toujours 50 % sera calibré sur un ensemble dont environ la moitié des issues se réalise. Sur 10 questions fictives avec 8 OUI, ses annonces moyennes de 0,50 diffèrent de la fréquence observée de 0,80. C'est pourquoi on regarde les 2 ensemble. Le score de Brier, une fonction de score probabiliste pour un événement binaire, pénalise l'écart quadratique entre ta probabilité et le résultat, et mélange donc calibration et finesse en un seul nombre.
Cette agrégation est pratique mais opaque : 2 personnes peuvent afficher le même score de Brier avec des profils opposés, l'une bien calibrée mais timide, l'autre tranchante mais systématiquement trop confiante. Garde donc une lecture par tranche à côté du score global.
Une tranche de 10 prévisions à 70 %
Prenons un exemple entièrement illustratif : 10 prévisions indépendantes à 0,70 de probabilité, 7 se réalisent, 3 non. La moyenne annoncée est exactement 0,70 et la fréquence observée vaut 7 / 10 = 0,70. Dans cet exemple la tranche est parfaitement calibrée. C'est aussi un petit échantillon, et c'est là que le piège commence.
Avec 10 observations et une vraie probabilité de 0,70, l'écart type approximatif d'une proportion vaut racine(0,70 × 0,30 / 10) ≈ 0,145, soit environ 14,5 points. Une tranche qui tombe à 0,60 ou à 0,80 par hasard n'est donc pas nécessairement mal calibrée, et une tranche qui tombe pile à 0,70 n'est pas nécessairement juste. Une prévision isolée ne peut pas être qualifiée de calibrée ou non : la calibration n'apparaît qu'avec un ensemble.
Le calcul du score de Brier sur ces cas illustratifs : pour une prévision 0,70 suivie d'un OUI, (0,70 − 1)² = 0,09. Pour une prévision 0,20 suivie d'un NON, (0,20 − 0)² = 0,04. Si tu mélanges 5 prévisions 0,70 suivies de OUI et 5 prévisions 0,20 suivies de NON, la moyenne des annonces est 0,45 et la fréquence observée est 0,50. Le score de Brier moyen vaut (5 × 0,09 + 5 × 0,04) / 10 = 0,065. Ce chiffre n'a de sens que comparé à une référence : un score constant naïf sur les mêmes questions, ou ton propre score passé.
| Prévision | Résultat | Moyenne des annonces | Fréquence observée | Score de Brier |
|---|---|---|---|---|
| 0,70, 10 questions indépendantes | 7 OUI / 3 NON | 0,70 | 0,70 | (7 × 0,09 + 3 × 0,49) / 10 = 0,21 pour le groupe |
| 0,20, 5 questions indépendantes | 5 NON | 0,20 | 0,00 | 0,04 par NON |
| Mélange 5 à 0,70-OUI et 5 à 0,20-NON | 5 OUI / 5 NON | 0,45 | 0,50 | 0,065 en moyenne |
Choisir l'échantillon avant les résultats
Une courbe de calibration n'est interprétable que si l'ensemble est comparable et choisi avant de connaître les résultats. 3 dérives classiques : retenir après coup les questions où tu t'es bien débrouillé, redéfinir les bornes d'une tranche en route, ou mélanger météo, finance et sport dans la même tranche alors que ces domaines n'ont pas le même comportement.
Fixe donc à l'avance la période, la catégorie de questions, les bornes des tranches (par exemple 0,60 à 0,70, puis 0,70 à 0,80) et la règle de résolution. Sur Metaculus, les critères objectifs de résolution doivent être conservés avec la question, ce qui réduit les interprétations divergentes, mais ne t'empêche pas de classer tes questions par type avant de mesurer.
Conserve pour chaque prévision la date, la question, la probabilité, le critère de résolution et le résultat. Ces colonnes permettent de reconstituer les tranches de probabilité, de compter leurs effectifs et de vérifier les calculs après résolution.
Interpréter un écart : ce que le protocole permet réellement
Le cas illustratif de 10 prévisions à 0,70, dont 7 OUI, permet de comparer probabilité annoncée et fréquence observée. Lorsqu'une tranche s'écarte de la moyenne annoncée, la première question à te poser est la taille de l'échantillon. Avec 10 observations à 0,70, l'écart type approximatif de la proportion est d'environ 0,145, donc un écart apparent de 10 points reste dans le bruit d'échantillonnage. Une tranche qui inclut beaucoup plus de prévisions réduit cet écart type, et un écart qui subsiste mérite alors une correction de tes prochaines annonces.
Le piège symétrique est de conclure trop vite à zéro erreur. Une tranche qui tombe exactement sur la moyenne annoncée, comme 0,70 sur 0,70 dans l'exemple, n'apporte pas une preuve de calibration parfaite. Sur un petit échantillon, cet ajustement peut être dû au hasard. La seule décision saine consiste à accumuler des observations dans la même tranche avant de trancher, en gardant la règle de résolution fixe.
Le score de Brier fournit un repère chiffré mais ne remplace pas cette lecture par tranche. Dans l'exemple, 0,09 pour un OUI à 0,70 et 0,04 pour un NON à 0,20 donnent une moyenne de 0,065 quand les 2 situations sont mélangées à parts égales. Pour décider, compare ce 0,065 à ce que tu aurais obtenu en annonçant simplement la fréquence de base, ou à ton propre score passé sur la même catégorie. Un score isolé ne suffit jamais à conclure.
Où continuer selon ta question
Si tu veux la mécanique complète du calcul, lis notre guide sur le score de Brier : il détaille la formule, sa lecture par tranche et ses limites quand tu compares 2 prévisionnistes avec des questions différentes.
Si ton sujet est la production des probabilités, notre guide sur l'IA et la prévision montre comment des modèles ou des assistants peuvent aider à formuler et documenter une estimation, sans remplacer la discipline de tenue de journal qui rend la calibration mesurable.
Et si tu passes de « suis-je calibré ? » à « que vaut cette décision ? », notre guide sur la valeur attendue et les probabilités t'aidera à séparer une probabilité bien posée du calcul de gain ou de perte qui en découle.
Sources et vérification
Sources consultées
Rédaction PolyZeno. Relecture automatisée avec DeepSeek V4.1 Flash.