OpenAI lance GPT-5.3-Codex, un modèle de codage en mode agent

OpenAI annonce le 5 février 2026 GPT-5.3-Codex, un modèle de codage en mode agent 25 % plus rapide que GPT-5.2-Codex, et le classe pour la première fois « High capability » en cybersécurité au titre de son Preparedness Framework.

5 min5 février 2026

Ce qu'OpenAI annonce

Le 5 février 2026, OpenAI publie « Introducing GPT-5.3-Codex », présenté comme le modèle de codage en mode agent le plus capable à ce jour. Le modèle réunit la performance de codage de pointe de GPT-5.2-Codex et les capacités de raisonnement et de connaissance professionnelle de GPT-5.2, le tout dans un seul modèle, et tourne 25 % plus vite que GPT-5.2-Codex pour les utilisateurs de Codex — un gain qu'OpenAI attribue à des améliorations de son infrastructure et de sa pile d'inférence.

Cette combinaison lui permet de mener des tâches longues mêlant recherche, usage d'outils et exécution complexe. L'utilisateur peut interagir avec le modèle pendant qu'il travaille — poser des questions, discuter des approches, le réorienter — sans qu'il ne perde le contexte de la tâche ; cette fonction de « steering » se règle dans l'app Codex (Settings > General > Follow-up behavior).

Fait notable relevé par OpenAI elle-même : des versions précoces de GPT-5.3-Codex ont servi à déboguer son propre entraînement, piloter son propre déploiement et diagnostiquer ses propres évaluations — la première fois, selon l'entreprise, qu'un de ses modèles contribue aussi directement à sa propre création.

Les chiffres de performance

OpenAI publie une série de comparaisons entre GPT-5.3-Codex, GPT-5.2-Codex et GPT-5.2, toutes mesurées en configuration de raisonnement « xhigh » :

  • SWE-Bench Pro (Public) — évaluation d'ingénierie logicielle réelle sur quatre langages : 56,8 % pour GPT-5.3-Codex, contre 56,4 % pour GPT-5.2-Codex et 55,6 % pour GPT-5.2.
  • Terminal-Bench 2.0 — compétences en ligne de commande d'un agent de codage : 77,3 %, contre 64,0 % et 62,2 %.
  • OSWorld-Verified — usage agentique d'un ordinateur de bureau via la vision : 64,7 %, contre 38,2 % et 37,9 % (à titre de repère, les humains obtiennent environ 72 % sur cette même évaluation).
  • SWE-Lancer IC Diamond : 81,4 %, contre 76,0 % et 74,6 %.
  • GDPval (tâches de travail de connaissance sur 44 métiers, taux de victoires ou d'égalités face à un expert humain) : 70,9 %, à égalité avec GPT-5.2 (également 70,9 %) ; la mesure n'est pas rapportée pour GPT-5.2-Codex.
  • Cybersecurity Capture The Flag Challenges (ensemble complet, toutes difficultés) : 77,6 %, contre 67,4 % et 67,7 %.

OpenAI indique par ailleurs que GPT-5.3-Codex atteint ces résultats en consommant moins de tokens qu'aucun modèle précédent.

Cybersécurité : première classification « High capability »

C'est le premier lancement qu'OpenAI traite comme « High capability » en cybersécurité au titre de son Preparedness Framework — et le premier modèle directement entraîné à identifier des vulnérabilités logicielles. L'entreprise est explicite sur l'incertitude : elle n'a « pas de preuve définitive » que le modèle puisse automatiser des cyberattaques de bout en bout, mais adopte une approche de précaution parce qu'il satisfait chacun des seuils d'alerte (« canary thresholds ») de son cadre — impossible, donc, d'exclure qu'il atteigne effectivement ce niveau.

Selon la fiche système (system card, publiée le même jour), GPT-5.3-Codex est le premier modèle à franchir les trois seuils d'évaluation cyber d'OpenAI à la fois : Capture-the-Flag professionnel, CVE-Bench (identification et exploitation de vulnérabilités réelles d'applications web) et Cyber Range (opérations cyber de bout en bout en réseau simulé). Sur le Capture-the-Flag professionnel spécifiquement, GPT-5.3-Codex égale GPT-5.2-Codex à 88 % (pass@12) — pas de progression nette sur ce test précis, la bascule venant plutôt de la constance obtenue sur l'ensemble des trois évaluations.

En conséquence, OpenAI déploie ce qu'elle présente comme sa pile de sécurité cyber la plus complète à ce jour : entraînement de sécurité du modèle, surveillance automatisée à deux niveaux (classification thématique puis analyse fine du contenu selon une taxonomie de menaces, avec un taux de rappel supérieur à 99,9 % sur les actions nuisibles), un programme Trusted Access for Cyber (TAC) permettant aux chercheurs en sécurité vérifiés de conserver un accès complet aux capacités avancées, et des mécanismes de sanction progressive (avertissement, restriction, suspension) pour les comptes qui sollicitent de façon répétée des usages nuisibles. Les requêtes détectées comme présentant un risque cyber élevé peuvent être automatiquement redirigées vers le modèle moins capable GPT-5.2.

Le modèle reste par ailleurs classé « High risk » dans le domaine biologique et chimique — au même titre que les autres modèles récents de la famille GPT-5, sans changement de dispositif — et n'atteint pas le seuil « High » sur l'auto-amélioration de l'IA. Côté écosystème, OpenAI élargit la bêta privée de son agent de recherche en sécurité Aardvark, engage 10 millions de dollars de crédits API pour la défense cyber (logiciels open source et infrastructures critiques prioritaires) et cite une collaboration avec des mainteneurs open source — dont Next.js, où un chercheur a utilisé Codex pour découvrir des vulnérabilités divulguées par Vercel la semaine précédant l'annonce.

Disponibilité

GPT-5.3-Codex est disponible dès l'annonce pour les offres ChatGPT payantes, partout où Codex est utilisable : l'app Codex, la CLI, l'extension IDE et le web. L'accès via l'API n'est pas ouvert au lancement ; OpenAI indique travailler à le rendre disponible « en toute sécurité, prochainement ». Le modèle a été co-conçu, entraîné et servi sur des systèmes NVIDIA GB200 NVL72.

Sources

  • OpenAI — Introducing GPT-5.3-Codex — 5 février 2026, annonce officielle
  • OpenAI — GPT-5.3-Codex System Card — 5 février 2026, fiche système officielle (Preparedness Framework)
  • OpenAI Deployment Safety Hub — GPT-5.3-Codex, Cyber Safeguards — détail des mitigations cybersécurité

Partager cet article

À lire aussi

Avant de partir

Un agent de code classé à risque cyber élevé : et votre pipeline ?

OpenAI classe pour la première fois un modèle « High capability » en cybersécurité, un signal à évaluer avant de l'intégrer à vos pipelines.