En 2026, les bancs d’essai historiques comme MMLU, HumanEval et GSM8K sont saturés, les modèles de pointe y dépassant régulièrement 90 %. L’évaluation des systèmes d’intelligence artificielle s’est donc déplacée vers des environnements dynamiques, experts et orientés agents.
Ce guide présente les 10 meilleurs benchmarks actuels, leurs critères d’évaluation et les performances réelles des modèles dominants pour vous aider à mesurer précisément leurs capacités.
1. LiveBench : la référence générale sans contamination
LiveBench s’impose comme le banc d’essai général par excellence pour départager les modèles de frontière. Sa conception élimine la contamination des données et le recours à des juges humains ou automatisés.
Plutôt que d’employer des fichiers statiques que les laboratoires d’IA risquent d’intégrer à leurs corpus d’entraînement, la plateforme génère chaque mois des questions inédites issues d’articles arXiv récents, d’actualités, de résumés de films IMDb et de jeux de données récents.
- Zéro contamination : renouvellement mensuel strict des questions depuis des sources en direct.
- Absence de juges LLM : la notation est strictement algorithmique et repose sur des réponses vérifiables, évitant les biais et les coûts liés aux juges tiers ou au travail participatif.
- Résistance à la saturation : les catégories les plus exigeantes maintiennent les meilleurs modèles dans une fourchette serrée de 70 % à 82 % de précision (ou 70 % à 80 % selon les séries de tests).
L’évaluation s’articule autour de 23 tâches objectives réparties en 7 catégories : Raisonnement, Mathématiques, Code, Langage, Suivi d’instructions (avec contraintes strictes de format ou de longueur) et Analyse de données (reformatage de tableaux JSON, Markdown, CSV et détection du typage des colonnes).
| Rang | Modèle | Score moyen global |
|---|---|---|
| 1 | DeepSeek V4.1 Flash (Max Effort / Poids ouverts) | 81,6% |
| 2 | GPT-5.6 Sol (Max Effort) | 81,1% |
| 3 | GPT-5.5 Thinking (xHigh Effort) | 81,0% |
| 4 | Claude 5 Opus Thinking (Max Effort) | 80,2% |
Sur les configurations à calcul maximal de test, OpenAI GPT-6 Astra Max Effort parvient également à atteindre 83,0 % sur cette plateforme. Les détails du code source sont accessibles sur le dépôt LiveBench.
2. LMSys Chatbot Arena : le standard des préférences humaines à l’aveugle
LMSys Chatbot Arena (LMArena) mesure les préférences conversationnelles réelles grâce à un système de classement Elo alimenté par plus d’un million de votes humains comparatifs et anonymes.
Ce protocole teste l’aptitude des modèles à répondre à des requêtes du monde réel telles que les utilisateurs les formulent au quotidien.
- Modèles en tête : Anthropic Claude Fable 5 et Claude Mythos 5 se partagent la première place générale pour la clarté, l’exactitude et la pertinence de leurs réponses.
- Percée des poids ouverts : sur le tableau spécialisé Frontend Coding, Moonshot Kimi K3 a pris la tête du classement face aux modèles propriétaires.
Limite identifiée : LMArena reste sensible au « biais de style ». Les votants humains ont naturellement tendance à privilégier les réponses longues et abondamment mises en page, même lorsqu’elles contiennent moins de substance réelle.
Pour suivre l’évolution des affrontements en direct, les classements sont consultables sur la plateforme LMSys Chatbot Arena.
3. SimpleQA : la détection des hallucinations et de la mémoire factuelle
Développé pour remplacer des bancs d’essai saturés comme TriviaQA, SimpleQA évalue la factualité courte et cible les hallucinations sans permettre au modèle de tricher par des recherches web ou des détours argumentatifs. Le jeu d’évaluation comprend 4 326 questions directes admettant une réponse unique et indiscutable.
Chaque réponse est classée selon trois issues strictes :
- Correct : le fait exact est énoncé.
- Incorrect : le modèle a deviné ou halluciné une fausse information.
- Not Attempted (Non tenté) : le modèle a explicitement indiqué qu’il ne connaissait pas la réponse.
Le comportement optimal consiste à maximiser les réponses correctes tout en admettant son ignorance dès qu’un doute subsiste.
Le banc d’essai a été décliné en deux versions techniques complémentaires :
- SimpleQA Verified : une sélection durcie de 1 000 requêtes nettoyée des doublons, dotée d’une notation plus stricte sur les valeurs numériques et intégrant des paramètres anti-abstention pour empêcher les modèles de gonfler leur score en refusant de répondre.
- Video SimpleQA : une extension multimodale évaluant l’ancrage de données factuelles précises au fil de séquences vidéo continues à étapes multiples.
| Rang | Modèle | Précision SimpleQA | Constat de performance |
|---|---|---|---|
| 1 | DeepSeek V4 Pro (0813) | 57,9% | Meilleure API propriétaire pour l’extraction factuelle brute. |
| 2 | Gemini 2.5 Pro | 55,6% | Détient le record F1 sur SimpleQA Verified. |
| 3 | DeepSeek V4 Pro Base | 55,2% | Modèle à poids ouverts le mieux classé sur les données paramétriques. |
| 4 | GPT-5 | ~50,2% | Forte calibration, mais taux d’abstention élevé sur le jeu initial. |
Les modèles de référence plus anciens comme GPT-4o stagnent sous les 40 %. Si la mémoire paramétrique pure plafonne entre 55 % et 60 %, les architectures associées à un système de recherche externe (RAG) tel que Tavily montent jusqu’à 93,3 % de précision en effectuant des requêtes sur le web.
Pour approfondir le protocole, consultez la documentation SimpleQA.
4. ARC-AGI-2 : l’intelligence fluide et le raisonnement abstrait
Créé à l’origine par François Chollet en 2019, l’Abstraction and Reasoning Corpus teste l’acquisition de compétences nouvelles et le raisonnement logique pur face à des grilles visuelles inédites. La version ARC-AGI-2 durcit les règles : elle élimine les tâches solubles par recherche brute de programmes pour cibler des interactions complexes de règles multiples, de sens symbolique et d’adaptations contextuelles.
- Fonctionnement : le modèle reçoit quelques paires de démonstration (entrées et sorties de grilles modifiées selon une règle cachée), puis doit appliquer cette règle à une grille de test jamais vue.
- Contraintes : chaque problème applique une règle inédite, interdisant toute mémorisation. Le système dispose d’exactement deux tentatives (
pass@2). - Base humaine : ces puzzles restent simples pour un être humain en s’appuyant sur des notions basiques (symétrie, inclusion, comptage). Les panels de contrôle humains affichent 100 % de taux de complétion (avec une moyenne individuelle par tâche de 60 % à 66 %).
Les modèles de langage de base obtiennent nativement 0 % sur ARC-AGI-2. Pour réussir, ils doivent exploiter des boucles d’adaptation et de réflexion au moment de l’inférence.
| Rang | Système / Modèle | Score ARC-AGI-2 | Type d’évaluation |
|---|---|---|---|
| 1 | OpenAI GPT-6 Astra (Max Compute) | 95,0% | Suivi d’API propriétaire |
| 2 | OpenAI GPT-5.6 Sol (Max Compute) | 92,5% | Suivi d’API propriétaire |
| 3 | Anthropic Claude Opus 5 (Max Effort) | 90,4% | Suivi d’API propriétaire |
| 4 | Anthropic Claude Fable 5.1 (Max Effort) | 90,0% | Suivi d’API propriétaire |
| 5 | rabbithole | 76,94% | Compétition publique Kaggle (budget contraint) |
| 6 | nvbanana | 72,08% | Compétition publique Kaggle (budget contraint) |
Le concours ARC Prize, doté de 2 000 000 $, a également inauguré ARC-AGI-3, une variante déployée dans des environnements interactifs d’agents pour repousser les limites des grilles statiques.
5. GPQA Diamond : le raisonnement scientifique de niveau doctorat
GPQA Diamond regroupe 198 questions à choix multiples rédigées par des spécialistes en physique, chimie et biologie. Elles sont formulées pour résister aux recherches web : un humain non-spécialiste disposant d’un accès internet complet et de 30 minutes de recherche par question ne dépasse pas 34 % de bonnes réponses.
- Validation croisée : chaque question du sous-ensemble Diamond a été validée par plusieurs experts indépendants titulaires d’un doctorat ayant abouti à la même réponse unique.
- Niveau d’expertise humaine : des spécialistes titulaires d’un doctorat testés dans leur propre domaine n’atteignent qu’entre 65 % et 69,7 % de précision sur ce jeu.
- Référence aléatoire : le choix au hasard parmi quatre propositions offre un taux de réussite de base de 25 %.
Les questions imposent des déductions académiques à plusieurs étapes. Sans chaîne de pensée (CoT) poussée ni boucles de calcul avancées, les modèles se font piéger par les options distractives.
| Rang | Modèle | Score de précision | Caractéristique principale |
|---|---|---|---|
| 1 | OpenAI GPT-6 Astra (Max/X-High) | 96,1% – 96,3% | Niveau record mondial ; montée en puissance à l’inférence. |
| 2 | Google Gemini 3.8 Flash | 95,3% | Efficacité remarquable de génération de jetons multi-étapes. |
| 3 | SpaceXAI Grok 4.6 | 94,9% | Raisonnement solide en chimie et en physique quantique. |
| 4 | Google Gemini 3.1 Pro Preview | 94,1% – 94,4% | Premier modèle à dépasser le palier des 94 %. |
| 5 | OpenAI GPT-5.6 Sol (Max) | 94,1% | Calibration de haut niveau sur les épreuves scientifiques. |
Avertissement : composé de seulement 198 questions, le sous-ensemble Diamond présente un risque élevé de fuite de données d’entraînement au fil du temps.
6. FrontierMath : l’épreuve reine des mathématiques avancées
Conçu par l’organisation de recherche Epoch AI, ce banc d’essai évalue le raisonnement mathématique de pointe. Loin des exercices classiques d’algèbre ou de calcul différentiel, FrontierMath rassemble des centaines de problèmes originaux et non publiés en théorie des nombres, géométrie algébrique, théorie des catégories et analyse réelle. Résoudre un seul problème demande plusieurs heures, voire plusieurs jours de travail à un mathématicien titulaire d’un doctorat.
Le banc d’essai se divise en plusieurs parcours techniques :
- L’audit de juin 2026 (V2) : une révision complète a corrigé des formulations ambiguës qui touchaient 42 % des énoncés initiaux. La suite comprend les Tiers 1 à 3 (295 problèmes de niveau master et recherche exploratoire) et le Tier 4 (43 problèmes de niveau postdoctoral).
- Le volet Erdős : lancé en septembre 2026, ce parcours comprend 68 conjectures ouvertes étudiées par Paul Erdős, élaborées avec le mathématicien Thomas Bloom et formalisées en langage Lean. L’IA doit y produire des démonstrations ou réfutations formellement vérifiables par machine.
- Règles d’évaluation : la notation est binaire (1 point pour la valeur exacte, 0 pour tout le reste, sans point partiel). Les modèles peuvent exécuter du code Python pendant l’inférence pour éliminer les erreurs de calcul pur. Seuls 12 problèmes exemples sont publics pour empêcher l’aspiration des solutions.
| Rang | Modèle | Précision Tiers 1–3 (v2) | Constat |
|---|---|---|---|
| 1 | OpenAI GPT-5.6 Sol | 89,0% | Tête du classement BenchLM Math Tracking. |
| 2 | OpenAI GPT-5.6 Terra | 84,9% | Excellente mise à l’échelle des jetons de test. |
| 3 | OpenAI GPT-5.6 Luna | 78,6% | Palier d’inférence mathématique à haut rendement. |
| 4 | Anthropic Claude Opus 4.8 | 47,2% | Meilleur modèle propriétaire hors OpenAI. |
| 5 | Moonshot Kimi K2.6 | 38,9% | Premier modèle à poids ouverts du tableau. |
Sur le volet d’excellence Erdős, OpenAI GPT-6 Astra est l’unique système au monde à dépasser 0 % en résolvant 2 des 68 problèmes formalisés (environ 3 % de précision), moyennant un coût de calcul massif à l’inférence. Tous les autres systèmes testés affichent 0 %. Les ressources officielles sont accessibles sur la page de FrontierMath d’Epoch AI.
7. SWE-bench Verified & Pro : l’ingénierie logicielle autonome
SWE-bench mesure l’aptitude d’un modèle à intervenir en tant qu’agent logiciel autonome au sein d’un dépôt de code complet. Au lieu de compléter des fonctions isolées, le système doit parcourir l’arborescence, identifier le bogue décrit dans un ticket GitHub réel, générer un patch fonctionnel et valider la suite de tests unitaires du projet.
Le banc d’essai se sépare en deux versions distinctes :
SWE-bench Verified (l’étalon de base)
Conçu avec OpenAI, ce sous-ensemble comprend 500 tâches issues de bibliothèques Python populaires (Django, Flask, scikit-learn), vérifiées par des développeurs humains pour garantir des consignes claires et des tests sans ambiguïté. En 2026, ce jeu souffre toutefois d’une forte contamination : ces tickets publics ayant été absorbés par les données d’entraînement des modèles récents, les scores traduisent souvent une mémorisation plutôt qu’une réelle déduction.
Ce tableau est proche de la saturation : Claude Opus 5 culmine à 96,0 %, Claude Mythos 5 à 95,5 %, et le modèle à poids ouverts Ornith-1.5 atteint 86,0 %.
SWE-bench Pro (la référence professionnelle)
Introduit par Scale AI, SWE-bench Pro propose 1 865 tâches réparties sur 41 dépôts actifs afin de contrer la contamination :
- Protection juridique GPL : la partie open-source exploite uniquement des dépôts sous licences copyleft strictes (GPL), interdisant légalement leur aspiration dans les modèles commerciaux.
- Volet propriétaire privé : 276 tâches proviennent directement de code d’entreprises et de jeunes pousses B2B, totalement inaccessibles au public.
- Complexité accrue : les tâches modifient en moyenne 107 lignes de code réparties sur 4,1 fichiers distincts.
Le passage à la version Pro entraîne une chute spectaculaire des performances : des modèles dépassant 70 % sur la version Verified chutent fréquemment autour de 23 % sur la suite Pro. Claude Fable 5.1 domine le classement Pro avec 81,2 %, suivi de Claude Mythos 5 à 80,3 %. L’ensemble des spécifications est publié sur le dépôt SWE-bench.
8. Terminal-Bench 2.0 : l’exécution en ligne de commande et DevOps
Développé par l’Université de Stanford et le Laude Institute, Terminal-Bench 2.0 teste la capacité d’un agent à manipuler un ordinateur de façon autonome via une interface en ligne de commande (CLI). L’agent est placé dans un conteneur Linux Docker sécurisé et reçoit une consigne en langage naturel.
- Vérification par état système : la notation ignore les messages de l’agent pour vérifier exclusivement l’état final de la machine et du système de fichiers via des tests automatisés de style
pytest. Si l’état de la machine n’est pas strictement conforme à l’issue attendue, le score attribué est de zéro. - Infrastructure : le test repose sur le framework Harbor pour la gestion sécurisée des conteneurs bac à sable et le suivi d’exécution, couplé à Terminus, un environnement terminal sans interface graphique dialoguant via des sessions actives
tmux. - Taxonomie des tâches : 89 tâches réelles exigeantes réparties en 16 domaines (Administration système, Débogage asynchrone, Cybersécurité, Gestion des conflits de fusion sous Git, et Modernisation de code ancien comme la réécriture complète de programmes COBOL en Python nécessitant plus de 100 appels d’outils successifs). Les tâches triviales comme l’affichage de « Hello World » ont été supprimées de la version 2.0.
| Rang | Modèle | Taux de résolution global | Particularité d’exécution |
|---|---|---|---|
| 1 | OpenAI GPT-6 Astra | 87,27% | Domine les tâches les plus ardues par recherche au moment du test. |
| 2 | OpenAI GPT-5.6 Sol | 85,77% – 91,9% | Suivi de premier ordre sur le tableau BenchLM Agent. |
| 3 | Anthropic Claude Fable 5.1 | 85,02% | Utilise des mécanismes de repli pour équilibrer la vitesse. |
| 4 | Anthropic Claude Opus 5 | 84,64% | Excellente interprétation des instructions complexes. |
Facteur d’échec et coût : l’analyse des erreurs démontre que la première cause d’échec des modèles moins avancés provient des erreurs d’invocation (tentatives d’exécuter des commandes inexistantes ou des drapeaux de commande invalides). Par ailleurs, exécuter ces agents sur des tâches longues peut s’avérer très onéreux, dépassant parfois 100 $ de consommation de jetons pour un unique problème complexe.
9. MMMU-Pro : la perception multimodale sans raccourci textuel
Alors que la première édition du benchmark MMMU souffrait de biais permettant aux modèles de deviner la réponse en lisant le texte sans analyser l’image, MMMU-Pro neutralise ces contournements pour mesurer la véritable fusion visuelle sur des sujets académiques complexes.
Le banc d’essai applique trois verrous méthodologiques stricts :
- Suppression des questions textuelles : toute question pouvant être résolue par un modèle de texte seul a été éliminée.
- Augmentation des choix de réponse : les questions proposent jusqu’à 10 options plausibles (abaissant le taux de réussite aléatoire à 10 %).
- Format d’entrée « Vision-Only » : dans la modalité la plus rigoureuse, le texte de la consigne et les propositions sont directement intégrés dans l’image sous la forme d’un bloc graphique. Le modèle ne reçoit aucune consigne textuelle externe et doit mobiliser son encodeur visuel pour retranscrire le texte tout en interprétant des graphiques spatiaux, des formules chimiques, des schémas physiques ou des partitions de musique.
| Rang | Modèle / Architecture | Précision globale MMMU-Pro | Détail de suivi |
|---|---|---|---|
| 1 | Chance Vision 1.5 | 86,9% | Première place du tableau officiel MMMU-Pro. |
| 2 | Google Gemini 3.5 Flash | 83,6% | Excellents résultats sur le suivi LLM Stats Vision. |
| 3 | OpenAI GPT-5.5 | 83,2% | Respect strict des contraintes structurelles. |
| 4 | OpenAI GPT-5.6 Sol | 83,0% | Grande régularité sur les épreuves de logique spatiale. |
| 5 | Google Gemini 3.0 Pro | 81,0% | Position dominante sur le volet image intégrée « Vision-Only ». |
Le niveau des spécialistes humains varie entre 80,8 % (moyenne de référence) et 85,4 % pour les chercheurs experts de leur discipline. Les systèmes de pointe ont ainsi rattrapé le niveau d’expertise humaine en raisonnement visuel.
10. Tau-bench : les interactions d’entreprise et l’usage d’outils
Développé par Sierra Research et l’Université de Princeton, Tau-bench évalue les interactions dynamiques entre l’outil, l’agent et l’utilisateur lors de conversations simulées en direct. L’agent doit interroger des API de bases de données, satisfaire les demandes d’un utilisateur simulé par un autre modèle de langage et respecter à la lettre les règles commerciales internes de l’entreprise (comme les conditions de remboursement de vols selon le statut de fidélité d’un client).
Le banc d’essai comprend trois générations successives :
τ-bench(la référence initiale) : comprend un secteur Retail (commerce en ligne avec plus de 1 000 commandes, 50 types d’articles et 115 cas de test pour gérer des suivis, modifications ou facturations) et un secteur Airline (50 tâches complexes comme le calcul de suppléments de bagages ou le réacheminement de vols).τ²-bench(l’extension opérationnelle) : ajoute le secteur Télécoms (dépannage matériel guidé, bascule en mode avion, vérification des configurations serveur) ainsi qu’une prise en charge vocale bidirectionnelle en streaming audio pour tester la résistance de l’agent aux interruptions orales directes sans désynchroniser ses appels d’outils.ττ-bench(Hyper-Tau, septembre 2026) : l’agent de programmation ne se contente plus de répondre ; il doit bâtir entièrement l’agent de service client à partir d’une base brute, d’un cahier des charges, d’une configuration d’API et d’un budget machine défini. Claude Opus 5 sous l’environnement Claude Code ne réussit que 23,9 % de ces tâches de conception.
La métrique de fiabilité
pass^k: contrairement aux bancs d’essai traditionnels qui emploient le scorepass@k(succès comptabilisé dès qu’une tentative réussit parmi plusieurs), Tau-bench impose lepass^k. L’agent doit réussir la tâche k fois consécutives face à des variations imprévisibles de l’utilisateur. En cas d’échec sur une seule session, la note est lourdement pénalisée. Sur ce barème, un modèle comme GPT-4o réussit moins de 50 % des cas au premier essai (pass^1) et s’effondre sous les 25 % àpass^8en raison de l’accumulation d’erreurs.
Les spécifications du projet sont détaillées sur la plateforme Tau-bench.
Synthèse : quel modèle domine chaque domaine en 2026 ?
Les données démontrent qu’aucun système d’intelligence artificielle ne s’impose uniformément sur l’ensemble des critères. Les classements dépendent de la nature précise des tâches testées :
- Génie logiciel et agents de code : Anthropic (série Claude 5). Claude Fable 5.1 mène sur SWE-bench Pro à 81,2 %, tandis que Claude Opus 5 détient le record absolu sur SWE-bench Verified à 96,0 %.
- Mathématiques pures et logique dynamique : OpenAI (générations GPT-5.6 et GPT-6). GPT-5.6 Sol affiche 89,0 % sur FrontierMath Tiers 1–3, et GPT-6 Astra est le seul modèle au monde à résoudre des conjectures ouvertes du parcours Erdős tout en menant LiveBench à 83,0 %.
- Raisonnement scientifique complexe : OpenAI GPT-6 Astra. Il détient le record sur GPQA Diamond avec 96,1 %, surpassant la moyenne des titulaires de doctorat.
- Fusion multimodale et logique visuelle : Chance Vision 1.5 (86,9 %) et Google Gemini 3.5 Flash (83,6 %) sur MMMU-Pro.
- Préférences conversationnelles humaines : Anthropic Claude Fable 5 et Claude Mythos 5, co-premiers sur LMSys Chatbot Arena.
- Modèles à poids ouverts : Alibaba Qwen3.8 Max s’impose comme le modèle ouvert le plus puissant sur BenchLM, tandis que Moonshot Kimi K3 s’est adjugé la première place du tableau Frontend Coding de LMArena devant les modèles propriétaires.
Comparatif de fiabilité des bancs d’essai
LiveBench représente le banc d’essai le plus fiable pour jauger l’intelligence générale et la logique grâce à ses ajouts mensuels sans contamination, son absence de juge LLM et son barème resserré résistant à la saturation. Selon vos cas d’usage, d’autres références complètent cette sélection :
| Benchmark | Objectif principal | Facteur de fiabilité | Limite identifiée |
|---|---|---|---|
| LMSys Chatbot Arena | Préférences humaines | Plus d’un million de votes comparatifs anonymes selon un barème Elo. | Sensible au biais de style (réponses longues et structurées artificiellement valorisées). |
| SWE-bench Pro | Agents de développement logiciel | Évalue les agents sur des dépôts GitHub complets avec tests unitaires stricts. | Très lourd à déployer localement et limité au domaine du génie logiciel. |
| GPQA Diamond | Expertise scientifique doctorale | Questions validées par des spécialistes pour être impossibles à chercher sur le web. | Ne comporte que 198 questions, d’où une forte sensibilité aux fuites de données au fil du temps. |
Pour vos protocoles d’évaluation, privilégiez LiveBench pour évaluer les capacités de logique pure non contaminées, LMSys Chatbot Arena pour observer ce que les utilisateurs plébiscitent en échange conversationnel, et SWE-bench Pro pour qualifier des agents autonomes dédiés aux environnements de production logicielle.