SWE-bench Verified
Résoudre de vrais tickets GitHub dans un dépôt réel — le test de référence du code agentique.
FrontièreLes benchmarks mesurent les capacités des modèles d'IA — code, raisonnement, connaissances. Ils sont utiles mais piégeux. Voici ce qu'ils mesurent vraiment, comment les lire, et où suivre les scores de Claude au fil des sorties (sans chiffres inventés : les valeurs exactes changent à chaque version).
Source : llm-stats.com · à jour au 3 août 2026
À noter : ce classement ne contient pas encore Claude Opus 5 (sorti le 24 juillet 2026) — sa source ne l'a pas évalué à ce jour. Anthropic annonce environ 96 % sur SWE-bench Verified, un chiffre issu d'une autre méthodologie : il n'est donc pas directement comparable aux lignes ci-dessus.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|
| SWE-bench ProCode agentique, non contaminé | 69.2% | 58.6% | 54.2% |
| Terminal-Bench 2.1Autonomie dans un terminal | 74.6% | 78.2% | 70.3% |
| OSWorld-VerifiedPiloter un ordinateur | 83.4% | 78.7% | 76.2% |
| Humanity's Last ExamQuestions expertes (avec outils) | 57.9% | 52.2% | 51.4% |
| Finance Agent v2Agent financier | 53.9% | 51.8% | 43.0% |
Source : Model card Anthropic — Claude Opus 4.8 · conditions du fournisseur, à jour au 3 août 2026
Ces chiffres sont réels et datés, pas figés : un score dépend des conditions (avec ou sans outils, harnais, version) et bouge à chaque sortie de modèle. Comparez toujours à source et date égales — et testez sur votre propre tâche.
Résoudre de vrais tickets GitHub dans un dépôt réel — le test de référence du code agentique.
FrontièreVersion durcie de SWE-bench sur des dépôts activement maintenus, sans fuite de solution publique.
FrontièreAccomplir des tâches réelles dans un terminal (installer, configurer, déboguer) de bout en bout.
FrontièreProblèmes de code récents, publiés après l'entraînement — conçu contre la contamination.
FrontièreQuestions scientifiques de niveau doctorat, « Google-proof » — impossibles à simplement rechercher.
FrontièreDes milliers de questions expertes, multi-domaines, écrites pour rester dures très longtemps.
FrontièreMMLU durci : plus de choix et questions retravaillées pour rétablir un écart entre modèles.
ActifProblèmes d'olympiades de maths américaines — raisonnement mathématique de haut niveau.
FrontièreRaisonnement sur images + texte de niveau universitaire (schémas, graphiques, diagrammes).
ActifPiloter un vrai ordinateur (souris, clavier, apps) pour accomplir des tâches — computer use.
FrontièreÉcrire une fonction correcte à partir d'une consigne. Historique, aujourd'hui quasi plafonné.
SaturéQCM sur 57 domaines (droit, médecine, histoire…). La référence connaissances, désormais plafonnée.
SaturéQuelques références reviennent souvent : SWE-bench (résolution de vrais bugs logiciels, clé pour le code agentique), MMLU et MMLU-Pro (connaissances générales), GPQA (raisonnement scientifique de niveau expert), MATH et GSM8K (mathématiques), HumanEval (génération de code). Chacun éclaire une facette différente — aucun ne résume « l'intelligence » à lui seul.
Un score isolé ment souvent. Méfiez-vous de la contamination des données (le test a pu fuiter dans l'entraînement), des conditions (avec ou sans outils, avec quel prompt), et des versions comparées. Un modèle peut dominer un benchmark et décevoir sur votre tâche réelle. Le meilleur test reste le vôtre.
La nouvelle génération mesure l'usage d'outils et l'autonomie : SWE-bench Verified, TAU-bench, benchmarks d'agents. C'est là que se joue l'avenir, et là que les modèles taillés pour l'action — comme ceux derrière Claude Code — sont attendus au tournant.
Les chiffres évoluent à chaque sortie de modèle. Plutôt que de figer un classement vite périmé, suivez les annonces officielles et notre fil d'actualité, catégorie Modèles, qui relaie les résultats au fil de l'eau.
SWE-bench (et sa variante Verified) est la référence pour le code agentique, car il mesure la résolution de vrais problèmes logiciels, pas seulement des extraits isolés.
Cela dépend du benchmark et de la version comparée : Claude est régulièrement en tête sur le code agentique et le raisonnement, mais aucun modèle ne domine partout. Vérifiez les scores à jour.
Dans les annonces officielles d'Anthropic et dans notre fil (catégorie Modèles), qui relaie les benchmarks à chaque sortie.
Avec prudence : contamination des données, conditions de test et choix des versions peuvent fausser la lecture. Un score n'est qu'un indice, pas une vérité.
Claude News est édité par Héra SASU. Média indépendant, non affilié à Anthropic.