Le 8 juin 2026, Cognition — la société derrière l'agent de développement Devin — publie
« Introducing FrontierCode », un nouveau benchmark de code. Son constat de départ : les modèles
qui dominent des benchmarks comme SWE-Bench Pro produisent souvent des patchs qui, dans la vraie
vie, ne seraient jamais acceptés par un mainteneur humain — code qui fonctionne mais dévie du
style du dépôt, tests trop faibles, périmètre de la modification qui déborde de ce qui était
demandé.
Pour corriger ce biais, Cognition a construit FrontierCode directement avec les mainteneurs de
36 dépôts open source de premier plan, et plus de 20 développeurs open source ont conçu les
tâches elles-mêmes. Plutôt que de se demander seulement « est-ce que le code marche ? »,
FrontierCode évalue la fusionnabilité (mergeability) d'un patch sur six axes : la justesse
comportementale, la sécurité vis-à-vis des régressions, la propreté mécanique du code, la
justesse des tests, la discipline de périmètre et la qualité générale du code.
- Le benchmark compte 150 tâches, réparties en trois paliers emboîtés — du plus large
(Extended, 150 tâches) à un sous-ensemble de 100 tâches (Main), jusqu'au plus difficile,
Diamond, ses 50 tâches les plus exigeantes.
- Sur ce palier Diamond, le modèle en tête, Claude Opus 4.8, obtient un score de
13,4 % — le benchmark reste donc très loin d'être saturé.
- À titre de comparaison, GPT-5.5 obtient 6,3 % sur ce même palier Diamond.
- Cognition affiche un taux de faux positifs inférieur de 81 % à celui de SWE-Bench Pro : le
système de notation de FrontierCode se trompe beaucoup moins souvent en validant un patch qui
n'aurait en réalité pas dû l'être.
Le message de Cognition est que la génération de code par IA a besoin d'un jugement plus proche
de celui d'un vrai mainteneur : un patch qui « passe les tests » n'est pas la même chose qu'un
patch qu'un humain fusionnerait sans hésiter dans son dépôt. En s'appuyant sur des rubriques
construites avec de vrais mainteneurs open source plutôt que sur des tests automatisés seuls,
FrontierCode cherche à mesurer cet écart — et le score de 13,4 % du modèle le plus performant
suggère qu'il reste large, même pour les modèles de pointe de mi-2026.
- Cognition — Introducing FrontierCode — 8 juin 2026, publication officielle
- Cognition — FrontierCode Leaderboard — classement officiel des modèles