Comment évaluer un modèle de prévision IA
Tu veux savoir si un modèle de prévision IA t’aide à anticiper des événements binaires.
Dans ce guide
Geler les entrées à la date de prévision
Commence par figer tout ce qui est disponible au moment de la prévision : la question exacte, la règle de résolution, l’horodatage, la version du modèle, les instructions données et les sources alors accessibles. Exclus sans exception toute information apparue plus tard, y compris le résultat de l’événement lui-même. Tant que ces éléments ne sont pas verrouillés, la comparaison n’a pas de sens : une prévision faite après coup n’évalue rien.
Ce protocole reproductible est une méthode proposée par PolyZeno, pas un résultat déjà mesuré. Il impose de consigner les prévisions et les issues observées avant de calculer quoi que ce soit. Applique la même discipline à chaque question : la prévision, l’issue, la version du modèle et la source doivent être traçables ensemble.
Comparer sur un même ensemble de questions
Un modèle évalué sur des questions différentes de celles de sa référence ne se compare pas. Évalue les deux sur les mêmes questions, aux mêmes dates, avec le même horizon de résolution. Recense aussi les prévisions absentes : un modèle qui ne répond pas à certaines questions ne doit pas voir ces cas disparaître silencieusement des calculs. Documente la règle de sélection et chaque exclusion.
La pratique courante en évaluation probabiliste décompose un score propre en fiabilité et résolution, comme le fait Bröcker dans son article sur la décomposition des scores propres. Cette base théorique te donne un cadre pour interpréter ton ensemble de test : la fiabilité correspond à quel point tes probabilités annoncées correspondent aux fréquences observées ; la résolution, à ta capacité à distinguer les cas. Les deux se mesurent séparément, jamais confondues avec un seul chiffre.
Cette erreur porte sur 1 prévision. La précision d’un modèle se mesure sur un échantillon de résultats.
Calculer le score de Brier et interpréter les écarts
Pour une question binaire, le score de Brier est la moyenne des carrés des écarts entre probabilité et issue : (p – y)^2, avec p entre 0 et 1 et y valant 0 ou 1. Dans cette convention binaire de 0 à 1, le score va de 0 à 1 et plus il est bas, meilleur c’est. Une prévision à 0,8 donne 0,04 si l’issue est 1, 0,64 si l’issue est 0. Une prévision constante à 0,5 donne 0,25 quelle que soit l’issue. Retiens ces valeurs de référence pour lire tes résultats.
Ne confonds pas 0,25 avec un seuil universel : ce n’est pas un objectif à atteindre ni une performance optimale. Un score unique ne prouve ni la calibration, ni la compétence sur un autre échantillon, ni la rentabilité après coûts. Pour utiliser l’outil de calcul, tu peux passer par le Calculateur de Brier qui applique cette convention 0 à 1. Indique toujours la taille de l’échantillon et la sélection des cas.
Séparer l’incertitude, les coûts et les limites
Après le score, examine la calibration séparément : par exemple, parmi toutes tes prévisions à 0,8, quelle proportion s’est effectivement réalisée ? La taille de l’échantillon joue ensuite un rôle direct : un petit nombre de questions rend les écarts instables. Rapporte un intervalle d’incertitude chaque fois que possible, plutôt qu’une moyenne seule.
Les coûts d’accès au modèle, de préparation des données ou de transaction ne sont pas inclus dans le score de Brier. Calcule-les séparément pour toute décision. De même, la méthode proposée ici n’est pas un classement de modèles ni la preuve d’une stratégie rentable : aucun résultat d’expérience n’a encore été mesuré pour cette méthode sur PolyZeno. Enfin, l’accès technique à un modèle ne détermine pas ce que la loi locale t’autorise à faire. Pour situer ces limites, consulte notre Politique éditoriale ainsi que la page sur l’Espérance de gain.
Sources et vérification
Rédaction PolyZeno. Relecture automatisée avec DeepSeek V4.1 Flash.