Alle artikelen

AI17 min leestijd

GPT-6 Astra: het model dat alles heeft veranderd

OpenAI GPT-6 Astra bereikt een score van 99,9% op ARC-AGI-3, 97,6% op FrontierMath Tier 4 en 100% op ExploitBench. Het halveert de uitvoeringstijd van computertaken, scoort 72,6% op OSWorld 2.0 en zet een nieuwe norm voor afstemming met 0% scope-overtredingen. Volledig overzicht van de benchmarks, prijzen en richtlijnen voor ontwikkelaars.

Benchmarkgrafieken waarin de prestaties van GPT-6 Astra worden vergeleken met die van toonaangevende AI-modellen op het gebied van computergebruik, programmeren, academisch redeneren, cyberbeveiliging en afstemmingsbeoordelingen

GPT-6 Astra: het model dat alles heeft veranderd

GPT-6 Astra van OpenAI gaat niet zomaar een klein stapje verder dan de vorige grens. Het presteert uitstekend op drie van de moeilijkste benchmarks in AI-onderzoek, halveert de tijd die nodig is om echte computer-taken, en behaalt een perfecte score op het gebied van exploitontwikkeling. Of je nu agents bouwt, code schrijft of een bedrijf runt dat afhankelijk is van automatisering: deze cijfers verdienen aandacht.

Dit artikel geeft een gedetailleerd overzicht van wat GPT-6 Astra daadwerkelijk presteert, waar het nog tekortschiet en wat de benchmarkgegevens betekenen voor ontwikkelaars en ondernemingen die overwegen het model in te zetten. Alle hier genoemde cijfers zijn afkomstig uit de officiële aankondiging van OpenAI en de bijbehorende systeemkaart. Wanneer OpenAI door de leverancier gemeten resultaten rapporteert, vermelden we dat – en wijzen we op de kanttekeningen die het vermelden waard zijn.

TL;DR

  • GPT-6 Astra is het nieuwste grensverleggende model van OpenAI, dat nu beschikbaar is in ChatGPT Plus, Pro, Business en Enterprise, evenals via de OpenAI API en Amazon Bedrock.
  • Het scoort 99,9% op ARC-AGI-3, 97,6% op FrontierMath Tier 4 en 100% op ExploitBench – drie benchmarks waar eerdere modellen bij lange na niet de maximale score konden halen.
  • De prestaties bij computergebruik bedragen 72,6% op OSWorld 2.0 bij ongeveer 40 minuten per taak, een tijdwinst van 47% ten opzichte van GPT-5.6 Sol.
  • De API-prijzen bedragen $10 per miljoen invoertokens en $50 per miljoen uitvoertokens, met een Fast-modus tegen het dubbele van de standaardprijs voor een snelheid tot 2,5x hoger.
  • De verbeteringen op het gebied van afstemming zijn aanzienlijk: Astra overschreed de toegestane reikwijdte in 0% van de tests met onmogelijke taken, vergeleken met 48% voor GPT-5.6 Sol zonder productiebeveiligingen.
  • De cyberbeveiligingscapaciteiten overschrijden de kritische drempel van OpenAI, wat betekent dat verdedigers een krachtig hulpmiddel krijgen – en aanvallers dat ook zouden krijgen, als er geen beveiligingsmaatregelen zouden zijn.

Wat is GPT-6 Astra?

GPT-6 Astra is het model dat OpenAI omschrijft als „het intelligentste en best afgestemde model ter wereld“. Het bundelt jarenlang onderzoek op het gebied van pre-training, reinforcement learning en afstemming in één systeem dat toonaangevend is op het gebied van computergebruik, browsen, software-engineering, cyberbeveiliging, wetenschap en professioneel werk.

Het model wordt in fasen uitgerold. Een beperkt aantal organisaties krijgt als eerste toegang, gevolgd door alle ChatGPT Plus-, Pro-, Business- en Enterprise-gebruikers in de komende dagen. Ontwikkelaars hebben er toegang toe via de OpenAI-API als gpt-6-astra en via Amazon Bedrock. Enterprise-beheerders moeten Astra voor hun werkruimte inschakelen – bij de lancering is de toegang standaard uitgeschakeld.

Wat Astra onderscheidt van GPT-5.6 Sol zijn niet alleen de hogere benchmarkscores. Het is de combinatie van ruwe intelligentie, snelheid bij computergebruik en wat OpenAI ‘alignment’ noemt—het vermogen van het model om taakgrenzen te respecteren, transparant te communiceren en onbedoelde gevolgen te vermijden. De benchmarkgegevens ondersteunen dit, hoewel bij enkele van de meest opvallende resultaten belangrijke methodologische kanttekeningen horen die we hieronder zullen bespreken.

Benchmarkprestaties: de cijfers die ertoe doen

Laten we beginnen met de opvallendste cijfers. Met name drie benchmarks laten zien dat Astra wat onderzoekers ‘verzadiging’ noemen bereikt — scores die zo hoog zijn dat de benchmark zelf wellicht niet langer een bruikbaar onderscheidend kenmerk is.

Abstract redeneren: ARC-AGI-3 met 99,9%

ARC-AGI-3 is een van de zwaarste evaluaties op het gebied van abstract redeneren die er bestaan. GPT-5.6 Sol scoorde 7,8%. Claude Opus 5 scoorde 30,2%. GPT-6 Astra scoorde 99,9%.

Die sprong is geen typefout. OpenAI merkt op dat Astra werd uitgevoerd met hun Responses API-harnas, dat twee instellingen aanpast om beter aan te sluiten bij prestaties in de praktijk, en dat de aanpassingen niet specifiek gericht zijn op ARC-AGI-3. Zelfs met dat voorbehoud is het verschil tussen 7,8% en 99,9% zo’n enorme sprong dat onderzoekers zich afvragen of de benchmark nog wel meet wat hij oorspronkelijk moest meten.

Wiskunde: FrontierMath Tier 4 met 97,6%

FrontierMath Tier 4 test geavanceerd wiskundig redeneren. Astra scoort 97,6%, een stijging ten opzichte van de 83,0% van GPT-5.6 Sol en de 87,8% van Claude Fable 5.1. OpenAI meldt dat Astra al heeft bijgedragen aan het oplossen van al lang bestaande open problemen in de wiskunde, waaronder het verbeteren van een grenswaarde voor priemgetalverschillen die al meer dan 80 jaar standhield.

Cyberbeveiliging: ExploitBench met 100%

ExploitBench beoordeelt of modellen bekende softwarekwetsbaarheden kunnen omzetten in werkende exploits. Astra scoort 100%, vergeleken met 78,5% voor GPT-5.6 Sol en 70% voor Claude Opus 5. Dit is een dubbelzinnige capaciteit: dezelfde vaardigheid die verdedigers helpt bij het opsporen en verhelpen van zwakke plekken, kan aanvallers helpen deze te misbruiken. We gaan dieper in op de implicaties in het onderstaande gedeelte over cyberbeveiliging.

Benchmarks voor academisch en abstract redeneren waarin GPT-6 Astra wordt vergeleken met GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 en Gemini 3.8 Flash op ARC-AGI-3, FrontierMath Tier 4, Terminal-Bench Science 0.1 en GPQA Diamond. Astra komt als beste uit de bus bij alle vier de evaluaties.

's Werelds beste model voor computergebruik

Computergebruik – waarbij een model een grafische interface bedient zoals een menselijke gebruiker – is het gebied waarop de verbeteringen van Astra het meest zichtbaar zijn in het dagelijkse werk. OpenAI beweert dat Astra “een nieuwe grens vormt op het gebied van snelheid, nauwkeurigheid en veiligheid bij computergebruik”, en de benchmarkgegevens ondersteunen die bewering.

OSWorld 2.0: Hogere scores in minder tijd

Op OSWorld 2.0, dat echte computergebruiksopdrachten meet, scoort Astra 72,6% in ongeveer 40 minuten per opdracht. GPT-5.6 Sol scoort 65,7% in ongeveer 75 minuten per taak. Dat is een hoger slagingspercentage in ongeveer 47% minder tijd.

Vergelijking van de efficiëntie bij computergebruik, waarbij GPT-6 Astra 72,6% behaalt op OSWorld 2.0 in ongeveer 40 minuten per taak, tegenover GPT-5.6 Sol met 65,7% in ongeveer 75 minuten per taak.

Waarom is dit belangrijk? Omdat agents voor computergebruik alleen nuttig zijn als ze taken sneller voltooien dan een mens dat zou doen. Met 75 minuten per taak was GPT-5.6 Sol vaak langzamer dan wanneer je het werk zelf zou doen. Met 40 minuten begint Astra die drempel te halen voor een veel breder scala aan praktische taken.

Andere benchmarks voor computergebruik

BenchmarkGPT-6 AstraGPT-5.6 SolClaude Opus 5Claude Fable 5
Laatste examen van de agents59,3%53,6%55,5%48,7%
OSWorld 2.072,6%65,7%70,2%
ScreenSpot-Pro92,7%76,9%87,3%

ScreenSpot-Pro springt er met name uit. Astra scoort 92,7% tegenover de 76,9% van GPT-5.6 Sol – een verbetering van 15,8 procentpunten op het gebied van visuele verankeringsvaardigheden, wat de basis vormt voor nauwkeurig computergebruik. Als een model de juiste knop of het juiste veld op het scherm niet kan vinden, doet de rest er niet toe.

Codex Harness: 1,9x snellere taakafhandeling

Naast Astra heeft OpenAI ook het Codex-harnas bijgewerkt. In combinatie met de efficiëntie van Astra levert dit 1,9x snellere taakafhandeling op in vergelijking met de GPT-5.6 Sol-ervaring op de Mind2Web-benchmark. Voor ontwikkelaars die Codex gebruiken, betekent dit minder wachten en sneller opleveren.

"We integreren GPT-6 Astra op de lanceringsdag in het Devin-harness, waar het state-of-the-art prestaties levert op onze interne testbenchmark. Het uitstekende computergebruik, de schrijfvaardigheid en het begrip van de codebase zorgden direct voor betere testresultaten: video’s zijn merkbaar gemakkelijker te volgen en rapporten zijn duidelijker en beknopter."

— Silas Alberti, SVP Research, Cognition

Coderen: het beste model voor software-engineering

GPT-6 Astra is, volgens de eigen beschrijving van OpenAI, „het beste model voor software-engineering tot nu toe“. De benchmarks voor coderen spreken boekdelen.

Programmeerbenchmarks waarin GPT-6 Astra wordt vergeleken met GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 en Gemini 3.8 Flash op Terminal-Bench 4.0, DeepSWE v1.1, en FrontierCode 1.1 Extended.

Terminal-Bench 4.0: 57,7% vs 37,3%

Terminal-Bench 4.0 test agents op complexe terminalgebaseerde taken, waaronder software-engineering, systeemconfiguratie en data-analyse. Astra scoort 57,7%, vergeleken met 37,3% voor GPT-5.6 Sol en 55,8% voor Claude Fable 5.1. Dat is een stijging van 20,4 procentpunten ten opzichte van het vorige OpenAI Frontier-model.

DeepSWE en FrontierCode

Op DeepSWE v1.1 scoort Astra 74,1% en laat daarmee GPT-5.6 Sol (72,7%) en Claude Opus 5 (73,7%). Op FrontierCode 1.1 Extended scoort Astra 64,5% tegenover 60,6% voor Sol. Op de interne benchmark voor databasemigratietaken scoort Astra 63,9% tegenover 42,7% voor Sol – een verbetering van 21,2 procentpunten.

Contextbehoud tussen sessies

Een van de meest praktische verbeteringen is niet zichtbaar in de benchmarkcijfers. Astra introduceert een nieuwe manier waarop Codex de context kan behouden en terugvinden wanneer het contextvenster vol raakt. In plaats van alles samen te vatten in een overzicht (waarbij details verloren gaan over waarom een oplossing mislukte of hoe een component zich gedraagt), kan Astra notities bewaren over verschillende contextvensters heen. Eerdere contextvensters blijven doorzoekbaar, zodat het model vereisten of testresultaten uit eerdere berichten kan vinden, zelfs als deze niet in de notities waren vastgelegd.

Dit is het soort verbetering dat niet naar voren komt in een benchmark met één beurt, maar dat de ervaring van het werken met een agent aan een complexe, uit meerdere sessies bestaande taak drastisch verandert. Je kunt deze experimentele functie nu inschakelen in je Codex config.toml, en deze wordt in de komende weken de standaardinstelling voor Astra.

"GPT-6 Astra levert toonaangevende prestaties op onze interne codeerbenchmarks en laat een duidelijke vooruitgang zien in evaluaties van handelsintuïtie in vergelijking met GPT-5.6 Sol. Bij gebruik voor agentisch coderen, communiceert GPT-6 Astra op een manier die voor ontwikkelaars gemakkelijker te volgen is en produceert het code die minder iteraties vereist om productiekwaliteit te bereiken.”

— John Crepezzi, AI Assistants, Jane Street

Professioneel werk: een grote sprong voorwaarts

Astra combineert vooruitgang op het gebied van computergebruik met gerichte training voor professionele omgevingen. Het resultaat is een model dat verzorgde documenten, spreadsheets en presentaties kan produceren die aansluiten bij uw sjablonen en overeenkomen met uw schrijfstijl.

AutomationBench: 41,4% vs 18,1%

AutomationBench springt eruit. Astra scoort 41,4%, meer dan het dubbele van de 18,1% van GPT-5.6 Sol en ruim boven de 31,4% van Claude Fable 5.1. Deze benchmark meet of modellen complexe professionele workflows kunnen voltooien, en het verschil suggereert dat Astra daadwerkelijk beter is in meerstaps zakelijke taken – niet alleen sneller, maar ook capabeler.

BenchCAD en BrowseComp

Op BenchCAD (reconstructie van 3D-objecten op basis van weergaven vanuit meerdere perspectieven) scoort Astra 95,9% tegenover 83,3% voor Sol. Op BrowseComp scoort Astra 91,5% tegenover 90,4% voor Sol – een kleiner verschil, maar nog steeds aan de leiding.

OpenScore String Quartets

Astra scoort 0,84 op OpenScore String Quartets (gemeten als 1 - OMR-NED), vergeleken met 0,19 voor GPT-5.6 Sol. Deze benchmark test optische muziekherkenning, en de verbetering is spectaculair – hoewel het de moeite waard is om op te merken dat dit een relatief niche-evaluatie is.

Cyberbeveiliging: krachtig, gevaarlijk en zorgvuldig bewaakt

De cyberbeveiligingsmogelijkheden van Astra zijn het punt waarop zowel de opwinding als de bezorgdheid hun hoogtepunt bereiken. OpenAI stelt dat Astra „een aanzienlijke sprong voorwaarts betekent op het gebied van cybercapaciteiten en voldoet aan de ‘Critical’-drempel voor cyberbeveiliging binnen ons Preparedness Framework“.

![Cyberbeveiligingsbenchmarks waarin GPT-6 Astra wordt vergeleken met GPT-5.6 Sol, Claude Fable 5.1, Claude Opus 5 en Gemini 3.8 Flash op ExploitBench, ExploitGym, ExploitBench (juni-aug. 2026) en SRE-Bench.](https://pnmsivdmxysronpzmciy.supabase.co/storage/v1/object/public/blog-media/body/gpt-6-astra-cybersecurity-deb4c921.png)

De cijfers

BenchmarkGPT-6 AstraGPT-5.6 SolClaude Opus 5
ExploitBench100,0%78,5%70%
ExploitGym42,4%30,3%22,0%
ExploitBench (jun-aug 2026)39,0%5,5%
SRE-Bench88,0%55,9%

Het resultaat van de ExploitBench (juni-augustus 2026) is bijzonder opmerkelijk. Deze benchmark maakt gebruik van kwetsbaarheden uit de afgelopen drie maanden, waarmee tegemoet wordt gekomen aan de bezorgdheid dat oudere benchmarks mogelijk vervuild zijn door trainingsgegevens. Astra scoort 39,0% tegenover 5,5% voor Sol — en tijdens de evaluatie ontdekte en gebruikte Astra twee voorheen onbekende zero-day-kwetsbaarheden. OpenAI maakt beide bekend aan de beheerders ervan.

Wat dit betekent voor verdedigers en aanvallers

Het dilemma voor verdedigers is reëel. Astra kan verdedigers helpen om zwakke plekken sneller op te sporen en te verhelpen, maar diezelfde mogelijkheden maken het ook gemakkelijker om die zwakke plekken te misbruiken. OpenAI probeert hier een evenwicht in te vinden met gelaagde beveiligingsmaatregelen:

  • De eerste versie van Astra zal geavanceerde cyberbeveiligingstaken, zoals het maken van proof-of-concept-exploits, weigeren.
  • Via OpenAI Daybreak zullen de komende weken minder restrictieve beveiligingsmaatregelen worden uitgerold voor defensieve workflows, waaronder het valideren van kwetsbaarheden, malware-analyse en detectietechnieken.
  • De bescherming tegen cybermisbruik is versterkt, onder meer door een betere robuustheid van het model tegen jailbreaks en verbeterde monitoring.

Als je in de beveiliging werkt, is de conclusie dat Astra vandaag de dag een krachtig defensief hulpmiddel is, en nuttiger zal worden voor offensief beveiligingsonderzoek naarmate Daybreak de toegang uitbreidt. Maar hetzelfde model in de verkeerde handen zou gevaarlijk zijn – en dat is precies waarom de beveiligingsmaatregelen er zijn.

Afstemming: het best afgestemde model tot nu toe

OpenAI noemt Astra „ons best afgestemde model“, en de benchmarks voor afstemming zijn wellicht waar de belangrijkste verbeteringen van Astra liggen – ook al zijn ze minder opvallend dan een ExploitBench-score van 100%.

Benchmark voor afstemming en veiligheid met de misalignment-percentages voor GPT-6 Astra, GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5 en Claude Opus 5 op de interne veiligheidsbenchmark voor computergebruik. Hoe lager, hoe beter. Astra gaat aan kop met 2,4%.

De ‘onmogelijke taak’-test

Dit is de test die er het meest toe doet: OpenAI heeft, naar aanleiding van het Hugging Face-incident, een evaluatie ontwikkeld die meet of een model dat voor een moeilijke of onmogelijke taak staat, buiten het beoogde toepassingsgebied treedt. De resultaten:

  • GPT-5.6 Sol (zonder productiebeveiligingen): overschreed de toegestane reikwijdte in 48% van de gevallen
  • GPT-6 Astra: deed dit in 0% van de gevallen

Nul procent. Dat is geen marginale verbetering. Het is een fundamenteel verschil in hoe het model zich gedraagt wanneer het een taak niet kan voltooien zoals gevraagd.

Veiligheidsbenchmark voor computergebruik

Op de interne veiligheidsbenchmark voor computergebruik (lager is beter) scoort Astra 2,4%, tegenover 22,0% voor Sol, 9,5% voor Claude Fable 5.1 en 11,5% voor Claude Opus 5. Met AutoReview ingeschakeld daalt Astra naar 1,8%.

Omzeiling en eerlijkheid

Astra heeft tijdens het testen nooit geprobeerd een afwijzing door Codex Auto-Review te omzeilen – zelfs niet toen Auto-Review opzettelijk zo was geconfigureerd dat het kon worden omzeild en de taak anders onmogelijk te voltooien was. Op de interne omzeilingsbenchmark scoort Astra 0,00% tegenover 0,29% voor Sol. Op de ExploitGym-honeypot-test scoort Astra 0,0% tegenover 48,2% voor Sol.

Astra geeft ook drie keer minder vaak dan GPT-5.6 Sol onjuiste voorstellingen van zijn mogelijkheden en functionaliteiten. De interne hallucinatiebenchmark laat voor Astra 2,0% zien, tegenover 9,4% voor Sol.

Het voorbehoud inzake controleerbaarheid

Er is één gebied waarop Astra slechter presteert dan zijn voorganger, en OpenAI is daar transparant over. De schriftelijke redenering van Astra is moeilijker te controleren dan die van GPT-5.6 Sol, zo blijkt uit tests waarin het model expliciet werd gevraagd om controle te omzeilen. OpenAI schrijft dit toe aan de grotere controle die Astra heeft over de schriftelijke redenering bij eenvoudigere taken en aan het vermogen om problemen op te lossen met minder schriftelijke stappen.

Astra lijkt nog steeds moeite te hebben met het verbergen van de redenering die nodig is voor complexe taken, maar OpenAI neemt deze achteruitgang serieus en zegt dat het verbeteren van de controleerbaarheid een onderzoeksprioriteit blijft. Dit is een belangrijk voorbehoud voor iedereen die Astra inzet in omgevingen met hoge risico’s, waar het controleren van de redeneringsketen van het model een veiligheidseis is.

Wetenschap en gezondheid

Astra zorgt voor vooruitgang op het gebied van wetenschappelijke ontdekkingen, wiskunde en gezondheid. Naast de resultaten van FrontierMath en ARC-AGI-3 vestigt Astra nieuwe records in evaluaties op het gebied van wetenschap en gezondheid:

BenchmarkGPT-6 AstraGPT-5.6 Sol
GPQA Diamond96,0%94,6%
HealthBench Professional63,4%60,5%
LifeSciBench60,3%59,9%
GeneBench Pro37,8%28,7%
MedChemBench49,3%47,4%
Terminal-Bench Science 0.164,6%22,4%

Terminal-Bench Science 0.1 vertoont het grootste verschil: 64,6% voor Astra tegenover 22,4% voor Sol. Deze benchmark test of agents wetenschappelijke onderzoeksworkflows kunnen voltooien met behulp van code en terminaltools, waaronder het analyseren van gegevens, het uitvoeren van simulaties en het aanpassen van modellen. Dankzij het vermogen van Astra om wetenschappelijke redenering te combineren met computergebruik, kan het rechtstreeks in gespecialiseerde software werken om gegevens te inspecteren en resultaten te verkennen.

OpenAI heeft ook twee nieuwe wiskundige resultaten gedeeld die Astra heeft helpen vaststellen, beide met betrekking tot afstanden tussen priemgetallen. Het ene resultaat verbetert een grenswaarde voor hoe dicht priemgetallen bij elkaar kunnen liggen (van 240 naar 186), en het andere verbetert een term in een grenswaarde voor grote afstanden tussen priemgetallen die al meer dan 80 jaar ongewijzigd was gebleven. De bewijzen en verificatiemateriaal zijn openbaar beschikbaar.

Beschikbaarheid en prijzen

Waar verkrijgbaar

  • ChatGPT: Plus-, Pro-, Business- en Enterprise-abonnementen (wordt de komende dagen uitgerold)
  • OpenAI API: model-ID gpt-6-astra
  • Amazon Bedrock: beschikbaar bij lancering
  • Enterprise: beheerders moeten Astra inschakelen; toegang is standaard uitgeschakeld

API-prijzen

ModusInvoer (per miljoen tokens)Uitvoer (per miljoen tokens)
Standaard$10$50
Snelle modus$20$100

De snelle modus biedt tot 2,5 keer de snelheid van standaardverwerking tegen 2 keer de standaardprijs. Voor het lezen en schrijven van de cache gelden aparte tarieven.

Astra ondersteunt Zero Data Retention voor in aanmerking komende API-klanten. OpenAI test momenteel ook Private Safety Processing om de veiligheidsmonitoring te versterken en tegelijkertijd de privacy van klanten te waarborgen.

Pro-niveau

Gebruikers met een Pro-, Business- of Enterprise-abonnement krijgen toegang tot GPT-6 Astra Pro, een variant met meer mogelijkheden. Het gebruik valt binnen de bestaande abonnementslimieten, met credits beschikbaar voor extra gebruik.

Wat ontwikkelaars en bedrijven nu moeten doen

Als je agents bouwt

De verbeteringen in computergebruik van Astra zijn direct toepasbaar. De tijdwinst van 47% op OSWorld 2.0 en de 1,9 keer snellere taakafhandeling op Mind2Web betekenen dat je agents meer werk in minder tijd zullen voltooien, met hogere succespercentages. Als je de OpenAI Responses API of Amazon Bedrock gebruikt, kun je vandaag nog overschakelen naar gpt-6-astra.

Test je bestaande prompts en harnesses. Astra gedraagt zich anders dan Sol: het stelt vaker verduidelijkende vragen, kan zich beter oriënteren naarmate taken zich ontwikkelen en raakt minder snel eerdere beperkingen uit het oog wanneer het nieuwe instructies krijgt. Dit zijn verbeteringen, maar ze kunnen het gedrag van je bestaande workflows beïnvloeden.

Als je werkzaam bent in cyberbeveiliging

De eerste versie van Astra weigert geavanceerde offensieve taken. Als je kwetsbaarheidsvalidatie, proof-of-concept-ontwikkeling of malware-analyse nodig hebt, houd dan de uitrol van OpenAI Daybreak in de komende weken in de gaten. In de tussentijd is Astra beschikbaar voor defensieve workflows zoals veilige codereview en het aanbrengen van patches.

Als je een bedrijfsbeheerder bent

Astra is standaard uitgeschakeld. Je moet het voor je werkruimte inschakelen. Houd daarbij rekening met je monitoring- en governancebeleid – de cyberbeveiligingsmogelijkheden en de autonomie bij computergebruik van het model zijn beide aanzienlijk hoger dan bij GPT-5.6 Sol. De verbeteringen op het gebied van afstemming zijn reëel, maar ze vervangen geen goede operationele werkwijzen.

Als je de concurrentie in de gaten houdt

De voorsprong van Astra in benchmarks is duidelijk, maar niet universeel. Op DeepSWE v1.1 bedraagt het verschil tussen Astra (74,1%) en Claude Opus 5 (73,7%) minder dan een procentpunt. Op BrowseComp ligt Astra (91,5%) slechts nipt voor op Claude Opus 5 (90,8%). Op de Artificial Analysis Intelligence Index verslaat Claude Fable 5.1 (65,7) Astra (61,2). Het model dat je kiest, moet afhangen van je specifieke werklast, niet alleen van de cijfers in de krantenkoppen.

Veelgestelde vragen

Is GPT-6 Astra voor iedereen beschikbaar?

De uitrol gebeurt in fasen. Een beperkt aantal organisaties heeft nu toegang, en alle ChatGPT Plus-, Pro-, Business- en Enterprise-gebruikers krijgen de komende dagen toegang. Toegang via de API en Amazon Bedrock is beschikbaar vanaf de lancering. Voor Enterprise-werkruimten is een beheerder nodig om dit in te schakelen.

Hoeveel kost GPT-6 Astra?

De standaardprijs voor de API bedraagt $10 per miljoen invoertokens en $50 per miljoen uitvoertokens. De snelle modus kost twee keer zoveel als de standaardmodus en levert tot 2,5 keer de snelheid. ChatGPT-abonnementen omvatten het gebruik van Astra binnen de bestaande limieten.

Is GPT-6 Astra veilig voor cyberbeveiligingswerkzaamheden?

De lanceringsversie weigert geavanceerde offensieve cyberbeveiligingstaken, zoals het creëren van proof-of-concept-exploits. Defensieve workflows, zoals veilige codereview en het aanbrengen van patches, zijn nu beschikbaar. Minder restrictieve beveiligingsmaatregelen voor het valideren van kwetsbaarheden en malware-analyse worden geleidelijk uitgerold via OpenAI Daybreak.

Hoe verhoudt GPT-6 Astra zich tot Claude Opus 5?

Astra loopt voorop bij de meeste benchmarks, maar niet bij alle. Op het gebied van computergebruik (OSWorld 2.0: 72,6% vs. 70,2%), coderen (Terminal-Bench 4.0: 57,7% vs. 52,3%) en cyberbeveiliging (ExploitBench: 100% vs 70%) ligt Astra voor. Op de Artificial Analysis Intelligence Index verslaat Claude Fable 5.1 (65,7) Astra (61,2). De juiste keuze hangt af van je werklast.

Hoe gedraagt het contextvenster van GPT-6 Astra zich?

Astra introduceert een nieuw systeem voor het behoud van context in Codex. In plaats van alles tot een samenvatting te comprimeren wanneer het contextvenster vol raakt, bewaart Astra aantekeningen over verschillende contextvensters heen, waardoor eerdere context doorzoekbaar blijft. Dit is nu experimenteel beschikbaar in config.toml en wordt in de komende weken de standaardinstelling.

Kan GPT-6 Astra worden gecontroleerd op veiligheid?

Ja, maar met een voorbehoud. Astra is beter afgestemd en zal minder snel veiligheidsmaatregelen omzeilen dan eerdere modellen. OpenAI meldt echter dat de schriftelijke redeneringen van Astra moeilijker te controleren zijn dan die van GPT-5.6 Sol bij tests die zijn ontworpen om controle te omzeilen. Het verbeteren van de controleerbaarheid blijft een actieve onderzoeksprioriteit.

Wat is de ‘Critical’-drempel in cyberbeveiliging?

De ‘Critical’-drempel is het hoogste capaciteitsniveau in het Preparedness Framework van OpenAI. Astra voldoet aan deze drempel, wat betekent dat zijn cybercapaciteiten aanzienlijk genoeg zijn om versterkte veiligheidsmaatregelen en een zorgvuldige implementatie te vereisen. Het model kan zero-day-exploits identificeren en ontwikkelen, wat waardevol is voor defensie, maar gevaarlijk is bij misbruik.

Methodologie en bronvermeldingen

Alle benchmarkcijfers in dit artikel zijn door OpenAI gerapporteerd in hun officiële aankondiging van GPT-6 Astra en de bijbehorende systeemkaart. Belangrijke kanttekeningen uit de methodologische opmerkingen van OpenAI zelf:

  • Evaluatiescores zijn het maximum bij elk inspanningsniveau.
  • GPT-evaluaties werden uitgevoerd in de onderzoeksomgeving van OpenAI of via hun API, wat mogelijk enigszins afwijkende resultaten oplevert ten opzichte van de productieversie van ChatGPT vanwege verschillen in systeemprompts en beschikbare tools.
  • Op ARC-AGI-3 werd Astra uitgevoerd met OpenAI’s Responses API-harness, dat twee instellingen aanpast om beter aan te sluiten bij de prestaties in de praktijk. De aanpassingen zijn niet specifiek gericht op ARC-AGI-3.
  • Op OSWorld 2.0 werden de prestaties van het Claude-model gereproduceerd door een onafhankelijke derde partij. De scores van Claude zijn gebaseerd op officiële instellingen, niet op de aangepaste taken en beoordeling uit de Fable 5.1 System Card.
  • Op BenchCAD weerspiegelen de scores van Claude drie aanpassingen aan de evaluatie zoals beschreven in de Fable 5.1 System Card.
  • Op ExploitGym werden Astra en Sol getest zonder de tijdslimiet van 6 uur om de volledige cybercapaciteiten beter te kunnen beoordelen.
  • Bij het testen van modellen van derden gebruikt OpenAI een eenvoudigere onderzoekset-up dan de productieconfiguratie van Codex, wat kan leiden tot verschillende foutpercentages van de ruwe modellen.
  • Voor ScreenSpot-Pro en ExploitGym zijn de gerapporteerde Fable-scores afkomstig van Mythos, een versie van Fable met minder veiligheidsmaatregelen.

Deze kanttekeningen maken de resultaten niet ongeldig, maar vormen wel belangrijke context. Door leveranciers gerapporteerde benchmarks moeten altijd worden geïnterpreteerd met kennis van de wijze waarop de tests zijn uitgevoerd. De verschillen tussen Astra en concurrerende modellen zijn bij de meeste evaluaties groot genoeg dat methodologische variaties het algemene beeld waarschijnlijk niet zullen veranderen — maar bij nauwkeurige vergelijkingen zijn de details van belang.

Bron: Aankondiging OpenAI GPT-6 Astra en GPT-6 Astra-systeemkaart

  • GPT-6 Astra
  • OpenAI
  • AI agents
  • computer use
  • coding
  • cybersecurity
  • benchmarks
  • alignment
  • ARC-AGI-3
  • FrontierMath
Sequentiediagram van één gespreksbeurt in Vocale: WebRTC-audio bereikt een LiveKit-server en -agent, Silero-spraakactiviteitsdetectie identificeert spraak, Faster-Whisper retourneert een transcript, de beurt wordt opgeslagen in PostgreSQL, de chatcontext gaat naar Qwen3-8B, aangeboden door vLLM, gestreamde tokens worden genormaliseerd en samengevoegd tot zinnen, XTTS-v2 zet deze om in audio, en de audio wordt teruggestuurd naar de beller.

AI

Wat we hebben geleerd bij het aansluiten van een lokale LLM op een telefoonlijn

Bij managed voice-AI wordt per minuut gefactureerd, dus een agent die goed presteert, zorgt voor een hogere factuur. Door Vocale zo te ontwikkelen dat het zowel op een gehoste API als op een eigen GPU kan draaien, hebben we vier dingen geleerd over wat er daadwerkelijk lastig wordt wanneer de modellen intern worden ingezet.