Le 5 février 2026, OpenAI publie « Introducing GPT-5.3-Codex », présenté comme le modèle de
codage en mode agent le plus capable à ce jour. Le modèle réunit la performance de codage de
pointe de GPT-5.2-Codex et les capacités de raisonnement et de connaissance professionnelle de
GPT-5.2, le tout dans un seul modèle, et tourne 25 % plus vite que GPT-5.2-Codex pour les
utilisateurs de Codex — un gain qu'OpenAI attribue à des améliorations de son infrastructure et
de sa pile d'inférence.
Cette combinaison lui permet de mener des tâches longues mêlant recherche, usage d'outils et
exécution complexe. L'utilisateur peut interagir avec le modèle pendant qu'il travaille — poser
des questions, discuter des approches, le réorienter — sans qu'il ne perde le contexte de la
tâche ; cette fonction de « steering » se règle dans l'app Codex (Settings > General > Follow-up
behavior).
Fait notable relevé par OpenAI elle-même : des versions précoces de GPT-5.3-Codex ont servi à
déboguer son propre entraînement, piloter son propre déploiement et diagnostiquer ses propres
évaluations — la première fois, selon l'entreprise, qu'un de ses modèles contribue aussi
directement à sa propre création.
OpenAI publie une série de comparaisons entre GPT-5.3-Codex, GPT-5.2-Codex et GPT-5.2, toutes
mesurées en configuration de raisonnement « xhigh » :
- SWE-Bench Pro (Public) — évaluation d'ingénierie logicielle réelle sur quatre langages :
56,8 % pour GPT-5.3-Codex, contre 56,4 % pour GPT-5.2-Codex et 55,6 % pour GPT-5.2.
- Terminal-Bench 2.0 — compétences en ligne de commande d'un agent de codage : 77,3 %,
contre 64,0 % et 62,2 %.
- OSWorld-Verified — usage agentique d'un ordinateur de bureau via la vision : 64,7 %,
contre 38,2 % et 37,9 % (à titre de repère, les humains obtiennent environ 72 % sur
cette même évaluation).
- SWE-Lancer IC Diamond : 81,4 %, contre 76,0 % et 74,6 %.
- GDPval (tâches de travail de connaissance sur 44 métiers, taux de victoires ou d'égalités
face à un expert humain) : 70,9 %, à égalité avec GPT-5.2 (également 70,9 %) ; la mesure
n'est pas rapportée pour GPT-5.2-Codex.
- Cybersecurity Capture The Flag Challenges (ensemble complet, toutes difficultés) :
77,6 %, contre 67,4 % et 67,7 %.
OpenAI indique par ailleurs que GPT-5.3-Codex atteint ces résultats en consommant moins de
tokens qu'aucun modèle précédent.
C'est le premier lancement qu'OpenAI traite comme « High capability » en cybersécurité au
titre de son Preparedness Framework — et le premier modèle directement entraîné à identifier des
vulnérabilités logicielles. L'entreprise est explicite sur l'incertitude : elle n'a « pas de
preuve définitive » que le modèle puisse automatiser des cyberattaques de bout en bout, mais
adopte une approche de précaution parce qu'il satisfait chacun des seuils d'alerte (« canary
thresholds ») de son cadre — impossible, donc, d'exclure qu'il atteigne effectivement ce niveau.
Selon la fiche système (system card, publiée le même jour), GPT-5.3-Codex est le premier modèle à
franchir les trois seuils d'évaluation cyber d'OpenAI à la fois : Capture-the-Flag professionnel,
CVE-Bench (identification et exploitation de vulnérabilités réelles d'applications web) et Cyber
Range (opérations cyber de bout en bout en réseau simulé). Sur le Capture-the-Flag professionnel
spécifiquement, GPT-5.3-Codex égale GPT-5.2-Codex à 88 % (pass@12) — pas de progression nette
sur ce test précis, la bascule venant plutôt de la constance obtenue sur l'ensemble des trois
évaluations.
En conséquence, OpenAI déploie ce qu'elle présente comme sa pile de sécurité cyber la plus
complète à ce jour : entraînement de sécurité du modèle, surveillance automatisée à deux niveaux
(classification thématique puis analyse fine du contenu selon une taxonomie de menaces, avec un
taux de rappel supérieur à 99,9 % sur les actions nuisibles), un programme Trusted Access for
Cyber (TAC) permettant aux chercheurs en sécurité vérifiés de conserver un accès complet aux
capacités avancées, et des mécanismes de sanction progressive (avertissement, restriction,
suspension) pour les comptes qui sollicitent de façon répétée des usages nuisibles. Les requêtes
détectées comme présentant un risque cyber élevé peuvent être automatiquement redirigées vers le
modèle moins capable GPT-5.2.
Le modèle reste par ailleurs classé « High risk » dans le domaine biologique et chimique — au même
titre que les autres modèles récents de la famille GPT-5, sans changement de dispositif — et
n'atteint pas le seuil « High » sur l'auto-amélioration de l'IA. Côté écosystème, OpenAI élargit
la bêta privée de son agent de recherche en sécurité Aardvark, engage 10 millions de dollars
de crédits API pour la défense cyber (logiciels open source et infrastructures critiques
prioritaires) et cite une collaboration avec des mainteneurs open source — dont Next.js, où un
chercheur a utilisé Codex pour découvrir des vulnérabilités divulguées par Vercel la semaine
précédant l'annonce.
GPT-5.3-Codex est disponible dès l'annonce pour les offres ChatGPT payantes, partout où Codex
est utilisable : l'app Codex, la CLI, l'extension IDE et le web. L'accès via l'API n'est pas
ouvert au lancement ; OpenAI indique travailler à le rendre disponible « en toute sécurité,
prochainement ». Le modèle a été co-conçu, entraîné et servi sur des systèmes NVIDIA GB200 NVL72.
- OpenAI — Introducing GPT-5.3-Codex — 5 février 2026, annonce officielle
- OpenAI — GPT-5.3-Codex System Card — 5 février 2026, fiche système officielle (Preparedness Framework)
- OpenAI Deployment Safety Hub — GPT-5.3-Codex, Cyber Safeguards — détail des mitigations cybersécurité