Chaque point associe un niveau de confiance annoncé au taux de réussite réellement observé. Un analyste parfaitement calibré se situerait sur la diagonale : annoncer 70 % et réussir 70 % du temps. L'écart entre les deux est l'erreur de calibration attendue (ECE).
A1 — ECE 0.114
confiance annoncée 0.36 contre 0.00 observé sur 4 matchs; confiance annoncée 0.45 contre 0.52 observé sur 23 matchs; confiance annoncée 0.55 contre 0.66 observé sur 32 matchs; confiance annoncée 0.64 contre 0.81 observé sur 27 matchs; confiance annoncée 0.75 contre 0.77 observé sur 13 matchs; confiance annoncée 0.86 contre 0.80 observé sur 5 matchs.
A1-zero — ECE 0.135
confiance annoncée 0.38 contre 0.00 observé sur 2 matchs; confiance annoncée 0.45 contre 0.39 observé sur 13 matchs; confiance annoncée 0.55 contre 0.73 observé sur 37 matchs; confiance annoncée 0.65 contre 0.74 observé sur 23 matchs; confiance annoncée 0.75 contre 0.65 observé sur 17 matchs; confiance annoncée 0.84 contre 1.00 observé sur 7 matchs; confiance annoncée 0.93 contre 0.80 observé sur 5 matchs.
A2 — ECE 0.112
confiance annoncée 0.33 contre 0.33 observé sur 6 matchs; confiance annoncée 0.45 contre 0.63 observé sur 24 matchs; confiance annoncée 0.54 contre 0.56 observé sur 25 matchs; confiance annoncée 0.63 contre 0.82 observé sur 34 matchs; confiance annoncée 0.73 contre 0.70 observé sur 10 matchs; confiance annoncée 0.83 contre 0.80 observé sur 5 matchs.
A2-static — ECE 0.136
confiance annoncée 0.33 contre 0.33 observé sur 6 matchs; confiance annoncée 0.45 contre 0.63 observé sur 24 matchs; confiance annoncée 0.54 contre 0.50 observé sur 26 matchs; confiance annoncée 0.64 contre 0.87 observé sur 31 matchs; confiance annoncée 0.74 contre 0.80 observé sur 15 matchs; confiance annoncée 0.83 contre 0.50 observé sur 2 matchs.
A3 — ECE 0.100
confiance annoncée 0.33 contre 0.33 observé sur 6 matchs; confiance annoncée 0.45 contre 0.63 observé sur 24 matchs; confiance annoncée 0.55 contre 0.54 observé sur 28 matchs; confiance annoncée 0.63 contre 0.84 observé sur 25 matchs; confiance annoncée 0.74 contre 0.79 observé sur 14 matchs; confiance annoncée 0.84 contre 0.86 observé sur 7 matchs.
ELO — ECE 0.114
confiance annoncée 0.39 contre 0.56 observé sur 9 matchs; confiance annoncée 0.44 contre 0.48 observé sur 44 matchs; confiance annoncée 0.54 contre 0.77 observé sur 35 matchs; confiance annoncée 0.64 contre 0.69 observé sur 16 matchs.
ClosingLine — ECE 0.104
confiance annoncée 0.37 contre 0.33 observé sur 9 matchs; confiance annoncée 0.45 contre 0.65 observé sur 20 matchs; confiance annoncée 0.55 contre 0.62 observé sur 21 matchs; confiance annoncée 0.64 contre 0.74 observé sur 23 matchs; confiance annoncée 0.73 contre 0.85 observé sur 13 matchs; confiance annoncée 0.83 contre 0.81 observé sur 16 matchs; confiance annoncée 0.92 contre 0.50 observé sur 2 matchs.
Mo — ECE 0.074
confiance annoncée 0.53 contre 0.40 observé sur 30 matchs; confiance annoncée 0.62 contre 0.63 observé sur 40 matchs; confiance annoncée 0.73 contre 0.83 observé sur 23 matchs; confiance annoncée 0.83 contre 0.70 observé sur 10 matchs; confiance annoncée 0.90 contre 1.00 observé sur 1 matchs.
Courbe de fiabilité
Chaque point est une tranche de confiance. L'axe horizontal, c'est ce que l'analyste a annoncé. L'axe vertical, c'est ce qui s'est réellement passé. La diagonale, c'est la calibration parfaite : un point au-dessus signifie une sous-confiance, en dessous une surconfiance.
La course à la meilleure architecture
Toute l'expérience est ici. Chaque ligne est l'erreur de calibration d'une architecture d'IA à mesure que les matchs s'accumulent. Plus bas, c'est mieux : la ligne qui se stabilise vers le bas est l'architecture que nous bâtirions. Les trois systèmes d'IA sont en gras ; le marché des paris, l'ELO et Mo restent en pâle, comme référence.
Les analystes, côte à côte
Ce tableau commande les trois graphiques ci-dessus.
Quand un analyste annonce 70 pour cent, ce pronostic gagne-t-il vraiment 70 pour cent du temps ? C'est la question à laquelle répond ce graphique (les statisticiens l'appellent une courbe de fiabilité). Mis à jour après chaque match terminé. Il apparaît après la première journée comptabilisée.
En ligne après une journée de groupes
0 matchs comptabilisés sur ~24. La courbe de fiabilité paraît à 24, une journée de groupes complète.
La courbe de fiabilité sera mise en ligne à la fin de la première journée de groupes. Une courbe a besoin d'environ 24 matchs comptabilisés pour dire quelque chose d'honnête. La montrer plus tôt, ce serait du bruit déguisé en signal. Chaque match est déjà noté : consultez le verdict sur la page de tout match terminé.