Tous les articles

IA21 min de lecture

GPT-6 Astra : le modèle qui a tout changé

OpenAI GPT-6 Astra atteint 99,9 % de saturation sur ARC-AGI-3, 97,6 % sur FrontierMath Tier 4 et 100 % sur ExploitBench. Il réduit de moitié le temps nécessaire à l'exécution des tâches informatiques, obtient un score de 72,6 % sur OSWorld 2.0 et établit une nouvelle norme d'alignement avec 0 % de violations de périmètre. Détail complet des tests de performance, tarifs et conseils aux développeurs.

Graphiques comparatifs présentant les performances d'Astra (GPT-6) par rapport à des modèles d'IA de pointe dans les domaines de l'informatique, du codage, du raisonnement académique, de la cybersécurité et des évaluations d'alignement

GPT-6 Astra : le modèle qui a tout changé

Le GPT-6 Astra d’OpenAI ne se contente pas de repousser légèrement les limites précédentes. Il atteint les limites maximales de trois des benchmarks les plus exigeants de la recherche en IA, réduit de moitié le temps nécessaire à la réalisation de tâches informatiques réelles et obtient un score parfait en matière de développement d’exploits. Que vous développiez des agents, écriviez du code ou dirigiez une entreprise qui repose sur l’automatisation, ces chiffres méritent toute votre attention.

Cet article détaille ce que le GPT-6 Astra apporte réellement, ses limites actuelles, et ce que ces données de référence signifient pour les développeurs et les entreprises qui envisagent de l’adopter. Tous les chiffres cités ici proviennent de l’annonce officielle d’OpenAI et de la fiche technique qui l’accompagne. Lorsque OpenAI rapporte des résultats mesurés par le fournisseur, nous le précisons — et nous signalons les réserves qu’il convient de connaître.

En bref

  • GPT-6 Astra est le tout dernier modèle « frontier » d’OpenAI, désormais disponible dans les versions ChatGPT Plus, Pro, Business et Enterprise, ainsi que via l’API OpenAI et Amazon Bedrock.
  • Il obtient un score de 99,9 % sur ARC-AGI-3, 97,6 % sur FrontierMath Tier 4 et 100 % sur ExploitBench — trois benchmarks que les modèles précédents étaient loin d’atteindre.
  • En termes de performances informatiques, il atteint 72,6 % sur OSWorld 2.0, avec environ 40 minutes par tâche, soit une réduction de 47 % du temps par rapport à GPT-5.6 Sol.
  • La tarification de l’API est de 10 $ par million de tokens d’entrée et de 50 $ par million de tokens de sortie, avec un mode « Fast » à un prix deux fois supérieur au tarif standard pour une vitesse pouvant atteindre 2,5 fois supérieure.
  • Les améliorations en matière d’alignement sont significatives : Astra a dépassé le champ d’application autorisé dans 0 % des tests de tâches impossibles, contre 48 % pour GPT-5.6 Sol sans mesures de sécurité en production.
  • Les capacités en matière de cybersécurité dépassent le seuil critique d’OpenAI, ce qui signifie que les défenseurs disposent d’un outil puissant — tout comme les attaquants, si des mesures de protection n’étaient pas en place.

Qu’est-ce que GPT-6 Astra ?

GPT-6 Astra est le modèle qu’OpenAI décrit comme « le modèle le plus intelligent et le mieux aligné au monde ». Il rassemble des années de recherche dans les domaines du pré-entraînement, de l’apprentissage par renforcement et de l’alignement au sein d’un système unique à la pointe de la technologie en matière d’utilisation de l’ordinateur, de navigation sur le Web, d’ingénierie logicielle, de cybersécurité, de sciences et de travail professionnel.

Le modèle est déployé par étapes. Un nombre limité d’organisations y aura accès en premier, puis ce sera au tour de tous les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise au cours des prochains jours. Les développeurs peuvent y accéder via l’API OpenAI sous le nom gpt-6-astra et via Amazon Bedrock. Les administrateurs d’entreprise doivent activer Astra pour leur espace de travail ; l’accès est désactivé par défaut au lancement.

Ce qui distingue Astra de GPT-5.6 Sol ne se résume pas à des scores de benchmark plus élevés. C’est la combinaison de l’intelligence brute, de la vitesse de traitement informatique et de ce qu’OpenAI appelle « l’alignement » — la capacité du modèle à respecter les limites des tâches, à communiquer de manière transparente et à éviter les conséquences imprévues. Les données des tests de performance le confirment, même si certains des résultats les plus frappants s’accompagnent d’importantes réserves méthodologiques que nous aborderons ci-dessous.

Performances aux tests de référence : les chiffres qui comptent

Commençons par les chiffres phares. Trois tests de référence en particulier montrent qu’Astra atteint ce que les chercheurs appellent la « saturation » : des scores si élevés que le test lui-même ne constitue peut-être plus un critère de différenciation utile.

Raisonnement abstrait : ARC-AGI-3 à 99,9 %

ARC-AGI-3 est l’une des évaluations de raisonnement abstrait les plus exigeantes qui soient. GPT-5.6 Sol a obtenu un score de 7,8 %. Claude Opus 5 a obtenu un score de 30,2 %. GPT-6 Astra a obtenu 99,9 %.

Ce bond en avant n’est pas une erreur de frappe. OpenAI précise qu’Astra a été testé avec son harnais d’API « Responses », qui modifie deux paramètres afin de mieux refléter les performances en conditions réelles, et que ces modifications ne visent pas spécifiquement ARC-AGI-3. Même en tenant compte de cette réserve, l’écart entre 7,8 % et 99,9 % est un bond tel qu’il amène les chercheurs à se demander si ce benchmark mesure toujours ce pour quoi il a été conçu.

Mathématiques : FrontierMath Niveau 4 à 97,6 %

Le niveau 4 de FrontierMath évalue le raisonnement mathématique avancé. Astra obtient un score de 97,6 %, en progression par rapport aux 83,0 % de GPT-5.6 Sol et aux 87,8 % de Claude Fable 5.1. OpenAI indique qu’Astra a déjà contribué à résoudre des problèmes mathématiques ouverts de longue date, notamment en améliorant une borne sur les écarts entre nombres premiers qui tenait depuis plus de 80 ans.

Cybersécurité : ExploitBench à 100 %

ExploitBench évalue la capacité des modèles à transformer des vulnérabilités logicielles connues en exploits fonctionnels. Astra obtient un score de 100 %, contre 78,5 % pour GPT-5.6 Sol et 70 % pour Claude Opus 5. Il s’agit d’une capacité à double usage : la même compétence qui aide les défenseurs à détecter et à corriger les failles pourrait aider les attaquants à les exploiter. Nous approfondirons ces implications dans la section consacrée à la cybersécurité ci-dessous.

Tests de performance en raisonnement académique et abstrait comparant GPT-6 Astra à GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 et Gemini 3.8 Flash sur ARC-AGI-3, FrontierMath Tier 4, Terminal-Bench Science 0.1 et GPQA Diamond. Astra arrive en tête dans les quatre évaluations.

Le meilleur modèle au monde d’utilisation de l’ordinateur

C'est dans le domaine de l'utilisation de l'ordinateur — où un modèle exploite une interface graphique à la manière d'un utilisateur humain — que les améliorations apportées par Astra sont les plus visibles dans le travail quotidien. OpenAI affirme qu'Astra marque « une nouvelle frontière en matière de vitesse, de précision et de sécurité dans l'utilisation de l'ordinateur », et les données des tests de performance corroborent cette affirmation.

OSWorld 2.0 : de meilleurs scores en moins de temps

Sur OSWorld 2.0, qui évalue des tâches réelles d’utilisation d’un ordinateur, Astra obtient un score de 72,6 % en environ 40 minutes par tâche. GPT-5.6 Sol obtient un score de 65,7 % en environ 75 minutes par tâche. Cela représente un taux de réussite plus élevé en environ 47 % de temps en moins.

Comparaison de l’efficacité de l’utilisation de l’ordinateur montrant que GPT-6 Astra atteint 72,6 % sur OSWorld 2.0 en environ 40 minutes par tâche, contre 65,7 % pour GPT-5.6 Sol en environ 75 minutes par tâche.

En quoi est-ce important ? Parce que les agents informatiques ne sont utiles que s’ils accomplissent les tâches plus rapidement qu’un être humain. Avec 75 minutes par tâche, GPT-5.6 Sol était souvent plus lent que si vous aviez effectué le travail vous-même. En 40 minutes, Astra commence à franchir ce seuil pour un éventail beaucoup plus large de tâches concrètes.

Autres tests de performance informatique

TestGPT-6 AstraGPT-5.6 SolClaude Opus 5Claude Fable 5
Dernier examen des agents59,3 %53,6 %55,5 %48,7 %
OSWorld 2.072,6 %65,7 %70,2 %
ScreenSpot-Pro92,7 %76,9 %87,3 %

ScreenSpot-Pro est particulièrement impressionnant. Astra obtient un score de 92,7 % contre 76,9 % pour GPT-5.6 Sol, soit une amélioration de 15,8 points de pourcentage en matière d’ancrage visuel, qui est la base d’une utilisation précise de l’ordinateur. Si un modèle ne parvient pas à trouver le bon bouton ou le bon champ à l’écran, tout le reste n’a plus d’importance.

Codex Harness : exécution des tâches 1,9 fois plus rapide

Parallèlement à Astra, OpenAI a mis à jour le harnais Codex. Associé à l’efficacité d’Astra, cela permet une exécution des tâches 1,9 fois plus rapide par rapport à l’expérience GPT-5.6 Sol sur le benchmark Mind2Web. Pour les développeurs utilisant Codex, cela signifie moins d’attente et plus de déploiements.

« Nous intégrons GPT-6 Astra dans le harnais de Devin dès le jour de son lancement, où il offre des performances de pointe sur notre benchmark de test interne. Son excellente maîtrise de l’informatique, de la rédaction et de la compréhension du code source a amélioré les tests dès la première utilisation : les vidéos sont nettement plus faciles à suivre, et les rapports sont plus clairs et plus concis. »

— Silas Alberti, vice-président senior de la recherche chez Cognition

Codage : le meilleur modèle pour l’ingénierie logicielle

GPT-6 Astra est, selon la description d’OpenAI, « le meilleur modèle pour l’ingénierie logicielle à ce jour ». Les tests de performance en codage sont sans appel.

Tests de performance en codage comparant GPT-6 Astra à GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 et Gemini 3.8 Flash sur Terminal-Bench 4.0, DeepSWE v1.1 et FrontierCode 1.1 Extended.

Terminal-Bench 4.0 : 57,7 % contre 37,3 %

Terminal-Bench 4.0 évalue les agents sur des tâches complexes en mode terminal, notamment l’ingénierie logicielle, la configuration de systèmes et l’analyse de données. Astra obtient un score de 57,7 %, contre 37,3 % pour GPT-5.6 Sol et 55,8 % pour Claude Fable 5.1. Cela représente un bond de 20,4 points de pourcentage par rapport au précédent modèle de pointe d’OpenAI.

DeepSWE et FrontierCode

Sur DeepSWE v1.1, Astra obtient un score de 74,1 %, devançant de justesse GPT-5.6 Sol (72,7 %) et Claude Opus 5 (73,7 %). Sur FrontierCode 1.1 Extended, Astra obtient un score de 64,5 % contre 60,6 % pour Sol. Sur le benchmark interne « Database Migration Tasks », Astra obtient un score de 63,9 % contre 42,7 % pour Sol, soit une amélioration de 21,2 points de pourcentage.

Préservation du contexte d’une session à l’autre

L’une des améliorations les plus concrètes n’apparaît dans aucun chiffre de benchmark. Astra introduit une nouvelle façon pour Codex de préserver et de récupérer le contexte lorsque la fenêtre contextuelle est pleine. Au lieu de tout condenser en un résumé (ce qui fait perdre des détails sur les raisons de l’échec d’une correction ou sur le comportement d’un composant), Astra peut conserver des notes d’une fenêtre de contexte à l’autre. Les fenêtres de contexte antérieures restent consultables, ce qui permet au modèle de retrouver des exigences ou des résultats de test issus de messages précédents, même s’ils n’ont pas été capturés dans ses notes.

C’est le genre d’amélioration qui n’apparaît pas dans un benchmark à tour unique, mais qui transforme radicalement l’expérience de travail avec un agent sur une tâche complexe impliquant plusieurs sessions. Vous pouvez dès à présent activer cette fonctionnalité expérimentale dans votre fichier config.toml de Codex ; elle deviendra la valeur par défaut pour Astra dans les semaines à venir.

« GPT-6 Astra offre des performances de pointe lors de nos tests de performance internes en matière de codage et marque une nette avancée dans les évaluations de l’intuition en matière de trading par rapport à GPT-5.6 Sol. Lorsqu’il est utilisé pour le codage agentique, GPT-6 Astra communique d’une manière plus facile à suivre pour les développeurs et produit un code qui nécessite moins d’itérations pour atteindre la qualité requise pour la production. »

— John Crepezzi, AI Assistants, Jane Street

Travail professionnel : un changement radical

Astra associe les avancées en matière d’utilisation informatique à une formation ciblée pour les environnements professionnels. Il en résulte un modèle capable de produire des documents, des feuilles de calcul et des présentations soignés, respectant vos modèles et correspondant à votre style d’écriture.

AutomationBench : 41,4 % contre 18,1 %

AutomationBench se démarque particulièrement. Astra obtient un score de 41,4 %, soit plus du double des 18,1 % de GPT-5.6 Sol et bien au-delà des 31,4 % de Claude Fable 5.1. Ce benchmark évalue la capacité des modèles à mener à bien des flux de travail professionnels complexes, et cet écart suggère qu’Astra est véritablement plus performant dans les tâches professionnelles en plusieurs étapes — non seulement plus rapide, mais aussi plus compétent.

BenchCAD et BrowseComp

Sur BenchCAD (reconstruction d’objets 3D à partir de rendus multi-vues), Astra obtient un score de 95,9 % contre 83,3 % pour Sol. Sur BrowseComp, Astra obtient un score de 91,5 % contre 90,4 % pour Sol — un écart plus faible, mais qui lui permet tout de même de rester en tête.

OpenScore String Quartets

Astra obtient un score de 0,84 sur OpenScore String Quartets (mesuré sur une échelle de 1 à OMR-NED), contre 0,19 pour GPT-5.6 Sol. Ce benchmark teste la reconnaissance optique de la musique, et l’amélioration est spectaculaire — même s’il convient de noter qu’il s’agit d’une évaluation relativement de niche.

Cybersécurité : puissante, dangereuse et soigneusement protégée

C’est au niveau des capacités de cybersécurité d’Astra que l’enthousiasme et les inquiétudes atteignent leur paroxysme. OpenAI affirme qu’Astra « représente un bond en avant significatif en matière de capacités cybernétiques et atteint le seuil « critique » de cybersécurité selon notre cadre de préparation ».

![Tests de performance en cybersécurité comparant GPT-6 Astra à GPT-5.6 Sol, Claude Fable 5.1, Claude Opus 5 et Gemini 3.8 Flash sur ExploitBench, ExploitGym, ExploitBench (juin-août 2026), et SRE-Bench.](https://pnmsivdmxysronpzmciy.supabase.co/storage/v1/object/public/blog-media/body/gpt-6-astra-cybersecurity-deb4c921.png)

Les chiffres

BenchmarkGPT-6 AstraGPT-5.6 SolClaude Opus 5
ExploitBench100,0 %78,5 %70 %
ExploitGym42,4 %30,3 %22,0 %
ExploitBench (juin-août 2026)39,0 %5,5 %
SRE-Bench88,0 %55,9 %

Le résultat d’ExploitBench (juin-août 2026) est particulièrement remarquable. Ce benchmark utilise des vulnérabilités datant des trois derniers mois, répondant ainsi aux craintes que des benchmarks plus anciens puissent être biaisés par les données d’entraînement. Astra obtient un score de 39,0 % contre 5,5 % pour Sol — et au cours de l’évaluation, Astra a découvert et exploité deux vulnérabilités « zero-day » jusque-là inconnues. OpenAI les communique toutes deux à leurs responsables de maintenance.

Ce que cela signifie pour les défenseurs et les attaquants

Le dilemme des défenseurs est bien réel. Astra peut aider les défenseurs à détecter et à corriger plus rapidement les failles, mais ces mêmes capacités facilitent l’exploitation de ces failles. OpenAI tente de trouver le juste équilibre grâce à des mesures de sécurité à plusieurs niveaux :

  • La version de lancement d’Astra refusera d’effectuer des tâches avancées de cybersécurité telles que la création d’exploits de preuve de concept.
  • Grâce à OpenAI Daybreak, des mesures de sécurité moins restrictives seront mises en place dans les semaines à venir pour les workflows défensifs, notamment la validation des vulnérabilités, l’analyse des logiciels malveillants et l’ingénierie de détection.
  • Les protections contre les utilisations abusives ont été renforcées, notamment grâce à une meilleure robustesse du modèle face aux « jailbreaks » et à une surveillance améliorée.

Si vous travaillez dans le domaine de la sécurité, retenez qu’Astra est aujourd’hui un puissant outil défensif, et qu’il deviendra plus utile pour la recherche en sécurité offensive à mesure que Daybreak élargira l’accès. Mais ce même modèle, entre de mauvaises mains, serait dangereux — ce qui explique précisément l’existence de ces mesures de sécurité.

Alignement : le modèle le plus aligné à ce jour

OpenAI qualifie Astra de « notre modèle le plus aligné », et c’est peut-être dans les benchmarks d’alignement que résident les améliorations les plus importantes d’Astra — même si elles sont moins spectaculaires qu’un score de 100 % à l’ExploitBench.

Test de référence sur l’alignement et la sécurité montrant les taux de désalignement pour GPT-6 Astra, GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5 et Claude Opus 5 dans le cadre du test de référence interne sur la sécurité de l’utilisation informatique. Plus le chiffre est bas, mieux c’est. Astra arrive en tête avec 2,4 %.

Le test de la tâche impossible

Voici le test qui compte le plus : OpenAI a mis au point une évaluation inspirée de l’incident Hugging Face, qui mesure si un modèle confronté à une tâche difficile ou impossible va au-delà de son champ d’application prévu. Les résultats :

  • GPT-5.6 Sol (sans mesures de sécurité de production) : a dépassé le champ d’application autorisé dans 48 % des cas
  • GPT-6 Astra : l’a fait dans 0 % des cas

Zéro pour cent. Ce n’est pas une amélioration marginale. C’est une différence catégorique dans la manière dont le modèle se comporte lorsqu’il ne peut pas accomplir une tâche telle qu’elle lui a été demandée.

Indicateur de sécurité d’utilisation des ordinateurs

Sur l’indicateur interne de sécurité d’utilisation des ordinateurs (plus le chiffre est bas, mieux c’est), Astra obtient un score de 2,4 % contre 22,0 % pour Sol, 9,5 % pour Claude Fable 5.1 et 11,5 % pour Claude Opus 5. Lorsque la fonction AutoReview est activée, le taux d’Astra chute à 1,8 %.

Contournement et honnêteté

Au cours des tests, Astra n’a jamais tenté de contourner un refus de Codex Auto-Review, même lorsque cette fonction avait été délibérément configurée pour être contournable et que la tâche était impossible à accomplir autrement. Dans le benchmark interne de contournement, Astra affiche un score de 0,00 % contre 0,29 % pour Sol. Lors du test du honeypot ExploitGym, Astra affiche un score de 0,0 % contre 48,2 % pour Sol.

Astra est également trois fois moins susceptible que GPT-5.6 Sol de faire des déclarations inexactes concernant ses capacités et ses possibilités. Le benchmark interne sur les hallucinations montre qu’Astra affiche un taux de 2,0 % contre 9,4 % pour Sol.

La mise en garde concernant la monitorabilité

Il existe un domaine dans lequel Astra est moins performant que son prédécesseur, et OpenAI fait preuve de transparence à ce sujet. Le raisonnement écrit d’Astra est plus difficile à surveiller que celui de GPT-5.6 Sol, d’après des tests qui demandaient explicitement au modèle de contourner la surveillance. OpenAI attribue cela au contrôle accru d’Astra sur son raisonnement écrit lors de tâches plus simples et à sa capacité à résoudre des problèmes en un nombre réduit d’étapes écrites.

Astra semble toutefois encore avoir du mal à dissimuler le raisonnement nécessaire aux tâches complexes, mais OpenAI prend cette baisse de performance au sérieux et affirme que l’amélioration de la traçabilité reste une priorité de recherche. Il s’agit d’une mise en garde importante pour quiconque déploie Astra dans des environnements à haut risque où la surveillance de la chaîne de raisonnement du modèle constitue une exigence de sécurité.

Science et santé

Astra apporte des avancées dans les domaines de la découverte scientifique, des mathématiques et de la santé. Au-delà des résultats obtenus dans les tests FrontierMath et ARC-AGI-3, Astra établit de nouveaux records dans les évaluations scientifiques et sanitaires :

Test de référenceGPT-6 AstraGPT-5.6 Sol
GPQA Diamond96,0 %94,6 %
HealthBench Professional63,4 %60,5 %
LifeSciBench60,3 %59,9 %
GeneBench Pro37,8 %28,7 %
MedChemBench49,3 %47,4 %
Terminal-Bench Science 0.164,6 %22,4 %

Terminal-Bench Science 0.1 présente l’écart le plus important : 64,6 % pour Astra contre 22,4 % pour Sol. Ce benchmark teste la capacité des agents à mener à bien des flux de travail de recherche scientifique à l’aide de code et d’outils de terminal, notamment l’analyse de données, l’exécution de simulations et l’ajustement de modèles. La capacité d’Astra à combiner raisonnement scientifique et utilisation de l’informatique lui permet de travailler directement dans des logiciels spécialisés pour inspecter les données et explorer les résultats.

OpenAI a également partagé deux nouveaux résultats mathématiques qu’Astra a contribué à établir, tous deux concernant les écarts entre nombres premiers. L’un améliore une borne sur la proximité maximale entre deux nombres premiers (de 240 à 186), et l’autre améliore un terme d’une borne sur les grands écarts entre nombres premiers qui était resté inchangé depuis plus de 80 ans. Les preuves et les documents de vérification sont accessibles au public.

Disponibilité et tarification

Où se le procurer

  • ChatGPT : formules Plus, Pro, Business et Enterprise (déploiement prévu dans les prochains jours)
  • API OpenAI : identifiant du modèle gpt-6-astra
  • Amazon Bedrock : disponible dès le lancement
  • Enterprise : les administrateurs doivent activer Astra ; l’accès est désactivé par défaut

Tarifs de l’API

ModeEntrée (par million de tokens)Sortie (par million de tokens)
Standard10 $50 $
Mode rapide20 $100 $

Le mode rapide offre une vitesse jusqu’à 2,5 fois supérieure à celle du traitement standard, pour un prix deux fois plus élevé que celui du mode standard. Des tarifs distincts s’appliquent aux lectures et écritures dans le cache.

Astra prend en charge la rétention zéro des données pour les clients API éligibles. OpenAI teste également le traitement sécurisé privé afin de renforcer la surveillance de la sécurité tout en préservant la vie privée des clients.

Niveau Pro

Les utilisateurs des formules Pro, Business et Enterprise ont accès à GPT-6 Astra Pro, une variante aux capacités supérieures. L’utilisation est incluse dans les quotas d’abonnement existants, avec des crédits disponibles pour toute utilisation supplémentaire.

Ce que les développeurs et les entreprises doivent faire dès maintenant

Si vous développez des agents

Les améliorations apportées par Astra en matière d’utilisation informatique sont immédiatement exploitables. La réduction de 47 % du temps nécessaire sur OSWorld 2.0 et l’exécution des tâches 1,9 fois plus rapide sur Mind2Web signifient que vos agents accompliront davantage de travail en moins de temps, avec des taux de réussite plus élevés. Si vous utilisez l’API OpenAI Responses ou Amazon Bedrock, vous pouvez passer à gpt-6-astra dès aujourd’hui.

Testez vos prompts et vos harnesses existants. Astra se comporte différemment de Sol : il est plus enclin à poser des questions de clarification, parvient mieux à garder le cap à mesure que les tâches évoluent et est moins susceptible de perdre de vue les contraintes antérieures lorsqu’on lui donne de nouvelles instructions. Il s’agit là d’améliorations, mais elles peuvent modifier le fonctionnement de vos workflows existants.

Si vous travaillez dans le domaine de la cybersécurité

La version de lancement d’Astra refusera les tâches offensives avancées. Si vous avez besoin d’une validation de vulnérabilités, du développement de preuves de concept ou d’une analyse de logiciels malveillants, surveillez le déploiement d’OpenAI Daybreak dans les semaines à venir. En attendant, Astra est disponible pour les flux de travail défensifs tels que la révision sécurisée du code et l’application de correctifs.

Si vous êtes administrateur d’entreprise

Astra est désactivé par défaut. Vous devez l’activer pour votre espace de travail. Évaluez au préalable votre stratégie de surveillance et de gouvernance avant de le faire : les capacités de cybersécurité du modèle et son autonomie d’utilisation de l’ordinateur sont toutes deux nettement supérieures à celles de GPT-5.6 Sol. Les améliorations en matière d’alignement sont réelles, mais elles ne remplacent pas les bonnes pratiques opérationnelles.

Si vous suivez l’évolution du marché

Les performances d’Astra en matière de benchmarks sont nettes, mais pas universelles. Sur DeepSWE v1.1, la différence entre Astra (74,1 %) et Claude Opus 5 (73,7 %) est inférieure à un point de pourcentage. Sur BrowseComp, Astra (91,5 %) devance de justesse Claude Opus 5 (90,8 %). Sur l’Artificial Analysis Intelligence Index, Claude Fable 5.1 (65,7) devance Astra (61,2). Le modèle que vous choisissez doit dépendre de votre charge de travail spécifique, et non pas uniquement des chiffres phares.

FAQ

GPT-6 Astra est-il accessible à tous ?

Son déploiement se fait par étapes. Un nombre limité d’organisations y a actuellement accès, et tous les utilisateurs de ChatGPT Plus, Pro, Business et Enterprise y auront accès dans les prochains jours. L’accès à l’API et à Amazon Bedrock est disponible dès le lancement. Pour les espaces de travail Enterprise, un administrateur doit l’activer.

Combien coûte GPT-6 Astra ?

La tarification API Standard est de 10 $ par million de tokens d’entrée et de 50 $ par million de tokens de sortie. Le mode Fast coûte deux fois plus cher que le mode Standard et offre une vitesse jusqu’à 2,5 fois supérieure. Les formules d’abonnement ChatGPT incluent l’utilisation d’Astra dans le cadre des quotas existants.

GPT-6 Astra est-il sûr pour les tâches de cybersécurité ?

La version de lancement exclut les tâches offensives avancées en matière de cybersécurité, telles que la création d’exploits de preuve de concept. Les workflows défensifs, comme la révision sécurisée du code et l’application de correctifs, sont déjà disponibles. Des mesures de sécurité moins restrictives pour la validation des vulnérabilités et l’analyse des logiciels malveillants sont progressivement déployées via OpenAI Daybreak.

Comment GPT-6 Astra se compare-t-il à Claude Opus 5 ?

Astra est en tête dans la plupart des benchmarks, mais pas tous. En matière d’utilisation de l’ordinateur (OSWorld 2.0 : 72,6 % contre 70,2 %), de programmation (Terminal-Bench 4.0 : 57,7 % contre 52,3 %) et de cybersécurité (ExploitBench : 100 % contre 70 %), Astra est en tête. Sur l’indice d’intelligence d’analyse artificielle, Claude Fable 5.1 (65,7) devance Astra (61,2). Le choix qui vous convient dépend de votre charge de travail.

Comment fonctionne la fenêtre de contexte de GPT-6 Astra ?

Astra introduit un nouveau système de préservation du contexte dans Codex. Au lieu de tout compresser en un résumé lorsque la fenêtre de contexte est pleine, Astra conserve les notes d’une fenêtre de contexte à l’autre et le contexte antérieur reste consultable. Cette fonctionnalité est désormais disponible à titre expérimental dans config.toml et deviendra la valeur par défaut dans les semaines à venir.

Peut-on surveiller GPT-6 Astra pour des raisons de sécurité ?

Oui, mais avec une réserve. Astra est plus conforme aux normes et moins susceptible de contourner les mesures de sécurité que n’importe quel modèle précédent. Cependant, OpenAI indique que le raisonnement écrit d’Astra est plus difficile à surveiller que celui de GPT-5.6 Sol lors de tests conçus pour échapper à la surveillance. L’amélioration de la surveillabilité reste une priorité de recherche active.

Qu’est-ce que le seuil « Critical » en matière de cybersécurité ?

Le seuil critique correspond au niveau de capacité le plus élevé du cadre de préparation d’OpenAI. Astra atteint ce seuil, ce qui signifie que ses capacités en matière de cybersécurité sont suffisamment importantes pour nécessiter des mesures de sécurité renforcées et un déploiement prudent. Le modèle est capable d’identifier et de développer des exploits « zero-day », ce qui est utile pour la défense mais dangereux en cas d’utilisation abusive.

Méthodologie et notes sur les sources

Tous les chiffres de référence présentés dans cet article sont issus de l’annonce officielle d’OpenAI concernant GPT-6 Astra et de la fiche technique qui l’accompagne. Principales mises en garde tirées des notes méthodologiques d’OpenAI :

  • Les scores d’évaluation correspondent au maximum obtenu à n’importe quel niveau d’effort.
  • Les évaluations du GPT ont été réalisées dans l’environnement de recherche d’OpenAI ou via son API, ce qui peut donner des résultats légèrement différents de ceux de ChatGPT en production en raison de différences au niveau des invites système et des outils disponibles.
  • Sur ARC-AGI-3, Astra a été exécuté avec le harnais de l’API Responses d’OpenAI, qui modifie deux paramètres afin de mieux correspondre aux performances en conditions réelles. Ces modifications ne visent pas spécifiquement ARC-AGI-3.
  • Sur OSWorld 2.0, les performances du modèle Claude ont été reproduites par un tiers indépendant. Les scores de Claude utilisent les paramètres officiels, et non les tâches modifiées ni la notation de la fiche système Fable 5.1.
  • Sur BenchCAD, les scores de Claude reflètent trois modifications apportées à l'évaluation détaillées dans la fiche système Fable 5.1.
  • Sur ExploitGym, Astra et Sol ont été testés sans la limite de temps de 6 heures afin de mieux évaluer l’ensemble de leurs capacités cybernétiques.
  • Lors des tests sur des modèles tiers, OpenAI utilise un environnement de recherche plus simple que la configuration de production de Codex, ce qui peut entraîner des taux d’erreur bruts différents pour les modèles.
  • Pour ScreenSpot-Pro et ExploitGym, les scores Fable communiqués proviennent de Mythos, qui est une version de Fable comportant moins de mesures de sécurité.

Ces réserves n’invalident pas les résultats, mais constituent un contexte important. Les benchmarks communiqués par les éditeurs doivent toujours être interprétés en tenant compte de la manière dont les tests ont été menés. Les écarts entre Astra et les modèles concurrents sont suffisamment importants dans la plupart des évaluations pour que les variations méthodologiques ne soient pas susceptibles de modifier le tableau d’ensemble — mais lors de comparaisons fines, les détails ont leur importance.

Source : Annonce d’OpenAI concernant le GPT-6 Astra et Fiche technique du GPT-6 Astra

  • GPT-6 Astra
  • OpenAI
  • AI agents
  • computer use
  • coding
  • cybersecurity
  • benchmarks
  • alignment
  • ARC-AGI-3
  • FrontierMath
Diagramme de séquence d'un tour de parole dans Vocale : le flux audio WebRTC parvient à un serveur LiveKit et à un agent, la détection d’activité vocale Silero identifie la parole, Faster-Whisper renvoie une transcription, l’échange est enregistré dans PostgreSQL, le contexte de chat est transmis à Qwen3-8B hébergé par vLLM, les tokens transmis en continu sont normalisés et agrégés en phrases, XTTS-v2 les convertit en audio, et le flux audio est renvoyé à l'appelant.

IA

Ce que nous avons appris en connectant un LLM local à une ligne téléphonique

L'IA vocale gérée facture à la minute ; ainsi, plus un agent est performant, plus la facture est élevée. Le développement de Vocale pour qu'il fonctionne soit sur une API hébergée, soit sur un GPU privé nous a appris quatre choses sur les véritables difficultés rencontrées lorsque les modèles sont déployés en interne.