inocta.iomatch
Étude publiée · Coupe du Monde 2026

L'étude : la calibration avant la précision.

Un banc d'essai en direct, pré-enregistré, de trois architectures de raisonnement IA, mené sur les 104 matchs de la Coupe du Monde 2026. Le résultat, le jeu de données ouvert, et quatre façons de le lire.

Ce que nous avons trouvé

L'architecture du Comité a enregistré la plus faible erreur de calibration attendue de toutes les machines testées, une ECE de 0,100 sur 104 matchs comptabilisés, devant le marché des paris à 0,104, le Pipeline à 0,112 et le Solo à 0,114 (la référence humaine mise à part, à 0,074). Parmi les trois architectures de raisonnement IA, le Comité est le mieux calibré, et c'est la forme à privilégier quand une entreprise a besoin d'une probabilité fournie par l'IA à laquelle se fier.

L'architecture du Comité, trois IA qui débattent avec une quatrième anonyme qui tranche, est la mieux calibrée que nous ayons testée. De toutes les machines au tableau, c'est elle qui affiche la plus faible erreur de calibration. Quand un opérateur demande quelle forme d'IA choisir quand le chiffre doit être fiable, voilà la réponse.

Le résultat est directionnel, pas une arrivée serrée effacée par le bruit. L'intervalle bootstrap autour des meneurs se chevauche, ce que nous divulguons comme une limite qu'un second tournoi affinerait. Cela ne transforme pas la recommandation en résultat nul. On ne refuse pas de désigner la voiture la plus rapide parce que deux temps au tour tiennent dans la marge de mesure.

Les trois architectures

Trois façons de bâtir un prévisionniste IA, comparées sur les mêmes 104 matchs. Même question, trois formes de raisonnement.

Solo
Le Soliste

Une IA, un seul passage, aucun assistant. Elle reçoit le dossier de match complet en un appel.

Pipeline
La Chaîne de montage

Une chaîne de spécialistes, chaque étape s'appuyant sur la précédente. Elle garde des notes sur ses erreurs et les relit avant le match suivant.

Council
Le Comité

Trois IA différentes en discutent, parfois en désaccord marqué. Une quatrième tranche.

Découvrir les huit analystes →

Les données

L'étude compare trois architectures de raisonnement IA sur la calibration, sur les 104 matchs. Une ECE plus basse signifie une confiance à laquelle se fier. Le Comité mène.

Erreur de calibration (ECE), les trois architectures

1Council0.100
2Pipeline0.112
3Solo0.114

Plus bas c'est mieux. Le Comité affiche la plus faible erreur de calibration des trois architectures, et la plus faible de toutes les machines testées (la référence humaine mise à part).

Courbe de fiabilité

Chaque point est une tranche de confiance : ce que l'architecture a annoncé (horizontal) face à ce qui s'est produit (vertical). La diagonale est la calibration parfaite. Plus proche de la ligne, mieux c'est.

Voir les huit analystes sur la page de calibration →

Pourquoi cela compte pour une entreprise

Au football, les prévisions IA se rapprochent du marché des paris parce que le football a déjà un immense marché liquide qui résout ce problème. Une entreprise n'a pas un tel marché. Il n'y a pas de cote de clôture pour un pipeline du T3. Alors la prévision IA calibrée ne concurrence pas une référence, elle EST la référence qui manque à l'entreprise. Cela rend le Comité plus précieux pour un opérateur, pas moins.

Quatre façons de le lire

Deux lectures, deux langues. La lecture d'affaires est le résumé décisionnel. La lecture scientifique est le papier complet, de qualité évaluation par les pairs.

Lecture d'affaires

Le résumé décisionnel. Ce que le résultat signifie pour choisir une forme d'IA, en langage d'opérateur.

Lecture scientifique

Le papier complet. Méthodologie, pré-enregistrement, scoring, courbes de fiabilité, et chaque résultat.

Citer ce travail

Pré-enregistré sur OSF avant le premier match comptabilisé. Jeu de données ouvert, CC-BY 4.0.

Jeu de données ouvert (OSF)
https://osf.io/r5sbj/
Pré-enregistrement (OSF)
https://osf.io/ke35t/
Prépublication (Zenodo)
https://zenodo.org/records/21515539
APA
Kahlain, M. (2026). Calibration over Accuracy: A Pre-Registered Live Benchmark of Three AI Reasoning Architectures on the 2026 FIFA World Cup. OSF. https://doi.org/10.17605/OSF.IO/R5SBJ
BibTeX
@misc{kahlain2026calibration,
  author = {Kahlain, Mohamed},
  title = {Calibration over Accuracy: A Pre-Registered Live Benchmark of Three AI Reasoning Architectures on the 2026 FIFA World Cup},
  year = {2026},
  publisher = {OSF},
  doi = {10.17605/OSF.IO/R5SBJ},
  url = {https://doi.org/10.17605/OSF.IO/R5SBJ}
}

DOI · 10.17605/OSF.IO/R5SBJ

Explorer les données

Le banc d'essai complet est conservé comme archive publique. Le tableau des scores, les courbes de fiabilité et chaque prédiction de match restent en ligne.