Un nouveau benchmark de code fait tomber les modèles à 13/100

Cognition publie FrontierCode, un benchmark de code construit avec les mainteneurs de 36 dépôts open source, qui évalue si un patch serait réellement fusionné par un humain plutôt que s'il fait juste passer des tests. Le meilleur modèle, Claude Opus 4.8, n'obtient que 13,4 % sur le palier le plus difficile.

3 min9 juin 2026

Ce que Cognition a construit

Le 8 juin 2026, Cognition — la société derrière l'agent de développement Devin — publie « Introducing FrontierCode », un nouveau benchmark de code. Son constat de départ : les modèles qui dominent des benchmarks comme SWE-Bench Pro produisent souvent des patchs qui, dans la vraie vie, ne seraient jamais acceptés par un mainteneur humain — code qui fonctionne mais dévie du style du dépôt, tests trop faibles, périmètre de la modification qui déborde de ce qui était demandé.

Pour corriger ce biais, Cognition a construit FrontierCode directement avec les mainteneurs de 36 dépôts open source de premier plan, et plus de 20 développeurs open source ont conçu les tâches elles-mêmes. Plutôt que de se demander seulement « est-ce que le code marche ? », FrontierCode évalue la fusionnabilité (mergeability) d'un patch sur six axes : la justesse comportementale, la sécurité vis-à-vis des régressions, la propreté mécanique du code, la justesse des tests, la discipline de périmètre et la qualité générale du code.

Les chiffres

  • Le benchmark compte 150 tâches, réparties en trois paliers emboîtés — du plus large (Extended, 150 tâches) à un sous-ensemble de 100 tâches (Main), jusqu'au plus difficile, Diamond, ses 50 tâches les plus exigeantes.
  • Sur ce palier Diamond, le modèle en tête, Claude Opus 4.8, obtient un score de 13,4 % — le benchmark reste donc très loin d'être saturé.
  • À titre de comparaison, GPT-5.5 obtient 6,3 % sur ce même palier Diamond.
  • Cognition affiche un taux de faux positifs inférieur de 81 % à celui de SWE-Bench Pro : le système de notation de FrontierCode se trompe beaucoup moins souvent en validant un patch qui n'aurait en réalité pas dû l'être.

Pourquoi ça compte

Le message de Cognition est que la génération de code par IA a besoin d'un jugement plus proche de celui d'un vrai mainteneur : un patch qui « passe les tests » n'est pas la même chose qu'un patch qu'un humain fusionnerait sans hésiter dans son dépôt. En s'appuyant sur des rubriques construites avec de vrais mainteneurs open source plutôt que sur des tests automatisés seuls, FrontierCode cherche à mesurer cet écart — et le score de 13,4 % du modèle le plus performant suggère qu'il reste large, même pour les modèles de pointe de mi-2026.

Sources

  • Cognition — Introducing FrontierCode — 8 juin 2026, publication officielle
  • Cognition — FrontierCode Leaderboard — classement officiel des modèles

Partager cet article

À lire aussi

Avant de partir

Le meilleur modèle plafonne à 13,4 % sur le palier le plus dur