Ce que nous avons trouvé
L'architecture du Comité a enregistré la plus faible erreur de calibration attendue de toutes les machines testées, une ECE de 0,100 sur 104 matchs comptabilisés, devant le marché des paris à 0,104, le Pipeline à 0,112 et le Solo à 0,114 (la référence humaine mise à part, à 0,074). Parmi les trois architectures de raisonnement IA, le Comité est le mieux calibré, et c'est la forme à privilégier quand une entreprise a besoin d'une probabilité fournie par l'IA à laquelle se fier.
L'architecture du Comité, trois IA qui débattent avec une quatrième anonyme qui tranche, est la mieux calibrée que nous ayons testée. De toutes les machines au tableau, c'est elle qui affiche la plus faible erreur de calibration. Quand un opérateur demande quelle forme d'IA choisir quand le chiffre doit être fiable, voilà la réponse.
Le résultat est directionnel, pas une arrivée serrée effacée par le bruit. L'intervalle bootstrap autour des meneurs se chevauche, ce que nous divulguons comme une limite qu'un second tournoi affinerait. Cela ne transforme pas la recommandation en résultat nul. On ne refuse pas de désigner la voiture la plus rapide parce que deux temps au tour tiennent dans la marge de mesure.
Les trois architectures
Trois façons de bâtir un prévisionniste IA, comparées sur les mêmes 104 matchs. Même question, trois formes de raisonnement.
Une IA, un seul passage, aucun assistant. Elle reçoit le dossier de match complet en un appel.
Une chaîne de spécialistes, chaque étape s'appuyant sur la précédente. Elle garde des notes sur ses erreurs et les relit avant le match suivant.
Trois IA différentes en discutent, parfois en désaccord marqué. Une quatrième tranche.
Les données
L'étude compare trois architectures de raisonnement IA sur la calibration, sur les 104 matchs. Une ECE plus basse signifie une confiance à laquelle se fier. Le Comité mène.
Erreur de calibration (ECE), les trois architectures
Plus bas c'est mieux. Le Comité affiche la plus faible erreur de calibration des trois architectures, et la plus faible de toutes les machines testées (la référence humaine mise à part).
Courbe de fiabilité
Chaque point est une tranche de confiance : ce que l'architecture a annoncé (horizontal) face à ce qui s'est produit (vertical). La diagonale est la calibration parfaite. Plus proche de la ligne, mieux c'est.
Pourquoi cela compte pour une entreprise
Au football, les prévisions IA se rapprochent du marché des paris parce que le football a déjà un immense marché liquide qui résout ce problème. Une entreprise n'a pas un tel marché. Il n'y a pas de cote de clôture pour un pipeline du T3. Alors la prévision IA calibrée ne concurrence pas une référence, elle EST la référence qui manque à l'entreprise. Cela rend le Comité plus précieux pour un opérateur, pas moins.
Quatre façons de le lire
Deux lectures, deux langues. La lecture d'affaires est le résumé décisionnel. La lecture scientifique est le papier complet, de qualité évaluation par les pairs.
Lecture d'affaires
Le résumé décisionnel. Ce que le résultat signifie pour choisir une forme d'IA, en langage d'opérateur.
Lecture scientifique
Le papier complet. Méthodologie, pré-enregistrement, scoring, courbes de fiabilité, et chaque résultat.
Citer ce travail
Pré-enregistré sur OSF avant le premier match comptabilisé. Jeu de données ouvert, CC-BY 4.0.
Kahlain, M. (2026). Calibration over Accuracy: A Pre-Registered Live Benchmark of Three AI Reasoning Architectures on the 2026 FIFA World Cup. OSF. https://doi.org/10.17605/OSF.IO/R5SBJ
@misc{kahlain2026calibration,
author = {Kahlain, Mohamed},
title = {Calibration over Accuracy: A Pre-Registered Live Benchmark of Three AI Reasoning Architectures on the 2026 FIFA World Cup},
year = {2026},
publisher = {OSF},
doi = {10.17605/OSF.IO/R5SBJ},
url = {https://doi.org/10.17605/OSF.IO/R5SBJ}
}DOI · 10.17605/OSF.IO/R5SBJ
Explorer les données
Le banc d'essai complet est conservé comme archive publique. Le tableau des scores, les courbes de fiabilité et chaque prédiction de match restent en ligne.
