OpenAI a lancé GPT-5.4 le 5 mars 2026, son modèle le plus performant à ce jour. Il intègre pour la première fois l’utilisation native d’ordinateur et une fenêtre contextuelle d’un million de tokens.
Ce lancement intervient dans un contexte délicat pour la société de Sam Altman, confrontée à des critiques publiques liées à son partenariat avec le Département américain de la Défense. OpenAI répond en concentrant son annonce sur la valeur professionnelle du modèle, qu’elle qualifie de “modèle frontier le plus performant et le plus efficace pour le travail professionnel.”
Vers les agents IA vraiment autonomes
GPT-5.4 est le premier modèle grand public d’OpenAI à intégrer nativement la capacité d’utiliser un ordinateur de manière autonome. Concrètement, le modèle peut écrire du code pour exécuter des tâches sur une machine, lancer des applications, et naviguer dans un système d’exploitation via des commandes clavier et souris, sans intervention humaine. Cette fonctionnalité, attendue depuis des mois par les développeurs qui utilisent Codex, positionne GPT-5.4 comme un acteur central de la course aux agents IA autonomes.
OpenAI a également revu en profondeur la gestion de la fenêtre contextuelle. Le modèle accepte désormais des entrées allant jusqu’à 1 million de tokens via l’API, contre 400 000 tokens pour GPT-5.2. Cette évolution aligne OpenAI sur ses concurrents directs Google et Anthropic, qui proposaient déjà cette capacité sur leurs modèles phares. Pour les applications longues, comme l’analyse de contrats juridiques complexes ou la révision de grandes bases de code, l’impact est immédiat.
Des performances de benchmark en hausse significative
Les résultats publiés par OpenAI placent GPT-5.4 en tête sur plusieurs classements de référence. Le modèle obtient un score record de 83% sur GDPval, le test interne d’OpenAI qui mesure les performances sur des tâches de travail intellectuel. Il prend également la première place sur OSWorld-Verified et WebArena Verified, deux benchmarks spécialisés dans l’utilisation d’interfaces informatiques.
Le classement APEX-Agents de Mercor, conçu pour évaluer les compétences professionnelles dans les domaines juridique et financier, place aussi GPT-5.4 en première position. « GPT-5.4 excelle dans la création de livrables à long horizon tels que des présentations, des modèles financiers et des analyses juridiques », a déclaré Brendan Foody, PDG de Mercor, dans un communiqué officiel, « offrant des performances optimales tout en étant plus rapide et moins coûteux que les modèles frontier concurrents. » ([GPT-5.4] excels at creating long-horizon deliverables such as slide decks, financial models, and legal analysis, delivering top performance while running faster and at a lower cost than competitive frontier models.)
Sur la question des hallucinations, OpenAI indique que GPT-5.4 est 33% moins susceptible de commettre des erreurs dans des affirmations individuelles par rapport à GPT-5.2, et que ses réponses globales sont 18% moins susceptibles de contenir des erreurs.
Trois versions, trois niveaux d’accès
OpenAI commercialise GPT-5.4 sous trois formes distinctes, pensées pour des usages différents.
| Version | Disponibilité | Spécificité |
|---|---|---|
| GPT-5.4 (standard) | ChatGPT, Codex, API | Usage général, context window 1M tokens |
| GPT-5.4 Thinking | Abonnements Plus, Teams, Pro | Modèle de raisonnement, meilleure transparence du CoT |
| GPT-5.4 Pro | API, Enterprise, Edu | Haute performance, optimisé pour charges professionnelles |
La version standard est la plus accessible. La version GPT-5.4 Thinking introduit un modèle de raisonnement explicite, où le modèle détaille son processus de réflexion étape par étape. La version Pro, réservée aux abonnements Enterprise et Edu ainsi qu’à l’API, cible les entreprises ayant des besoins de performance intensifs.
Tool Search : une nouvelle architecture pour les outils
L’un des changements techniques les plus importants de cette version concerne la gestion des outils dans l’API. Jusqu’ici, chaque appel au modèle nécessitait d’inclure dans le prompt système la définition complète de tous les outils disponibles, ce qui consommait un grand nombre de tokens à mesure que les intégrations s’accumulaient.
Le nouveau système baptisé Tool Search permet au modèle de charger dynamiquement la définition d’un outil au moment où il en a besoin, plutôt que de tout précharger. Le résultat est une réduction directe du coût et de la latence pour les systèmes multi-outils complexes, un avantage concret pour les équipes qui développent des applications agentiques en production.
Sécurité : le chain-of-thought sous surveillance
OpenAI a introduit une nouvelle évaluation de sécurité spécifique à la transparence du raisonnement, un sujet qui préoccupe les chercheurs en sécurité de l’IA depuis plusieurs années. La crainte principale est qu’un modèle de raisonnement puisse produire une chaîne de pensée trompeuse, affichant un raisonnement qui ne correspond pas à ce qui guide réellement ses décisions.
Les tests réalisés par OpenAI montrent que ce phénomène est moins probable dans la version Thinking de GPT-5.4, ce qui « suggère que le modèle n’a pas la capacité de dissimuler son raisonnement et que la surveillance du CoT reste un outil de sécurité efficace. » Ce résultat, publié dans la system card officielle du modèle, apporte un argument concret aux équipes qui déploient des agents IA dans des environnements sensibles.
Tarification API
Les tarifs officiels publiés par OpenAI pour l’accès à GPT-5.4 via l’API sont les suivants :
Input : 2,50 dollars par million de tokens
Cached input : 0,25 dollar par million de tokens
Output : 15,00 dollars par million de tokens
Pour les prompts dépassant 272 000 tokens d’entrée (contexte long), OpenAI applique une tarification doublée sur les inputs et multipliée par 1,5 sur les outputs, sur l’ensemble de la session. Ce mécanisme de seuil concerne uniquement les versions GPT-5.4 et GPT-5.4 Pro, qui bénéficient de la fenêtre contextuelle étendue à 1,05 million de tokens.
Avec GPT-5.4, OpenAI consolide une stratégie cohérente : unifier dans un seul modèle les capacités de raisonnement, d’action et de traitement long que ses différentes versions précédentes fragmentaient. Pour les développeurs et les équipes IT qui misent sur des workflows automatisés, la prochaine étape sera d’évaluer si les gains de performance justifient la hausse de tarif par rapport à GPT-5.2. La mise à disposition dans Codex dès le lancement suggère qu’OpenAI parie sur les cas d’usage agentics comme principal moteur d’adoption.



No Comment! Be the first one.