IA19 min di lettura
GPT-6 Astra: il modello che ha cambiato tutto
OpenAI GPT-6 Astra raggiunge il 99,9% su ARC-AGI-3, il 97,6% su FrontierMath Tier 4 e il 100% su ExploitBench. Riduce della metà il tempo necessario per l'esecuzione delle attività al computer, ottiene un punteggio del 72,6% su OSWorld 2.0 e stabilisce un nuovo standard di allineamento con lo 0% di violazioni dell'ambito. Analisi completa dei benchmark, prezzi e linee guida per gli sviluppatori.

GPT-6 Astra: il modello che ha cambiato tutto
Il GPT-6 Astra di OpenAI non si limita a superare di poco i limiti precedenti. Raggiunge il limite massimo in tre dei benchmark più difficili nella ricerca sull’IA, dimezza il tempo necessario per completare attività reali di utilizzo del computer e ottiene un punteggio perfetto nello sviluppo di exploit. Che si tratti di creare agenti, scrivere codice o gestire un’azienda che dipende dall’automazione, questi numeri meritano attenzione.
Questo articolo analizza ciò che GPT-6 Astra offre effettivamente, dove presenta ancora delle lacune e cosa significano i dati dei benchmark per gli sviluppatori e le aziende che stanno valutando la sua adozione. Ogni dato citato in questo articolo proviene dall’annuncio ufficiale di OpenAI e dalla scheda tecnica di accompagnamento. Laddove OpenAI riporta risultati misurati dal fornitore, lo specifichiamo chiaramente, segnalando al contempo le avvertenze che vale la pena conoscere.
TL;DR
- GPT-6 Astra è il nuovissimo modello all’avanguardia di OpenAI, ora disponibile in ChatGPT Plus, Pro, Business ed Enterprise, oltre che nell’API di OpenAI e in Amazon Bedrock.
- Ottiene un punteggio del 99,9% su ARC-AGI-3, del 97,6% su FrontierMath Tier 4 e del 100% su ExploitBench—tre benchmark che i modelli precedenti non riuscivano nemmeno lontanamente a saturare.
- Le prestazioni nell’uso del computer raggiungono il 72,6% su OSWorld 2.0 con circa 40 minuti per attività, una riduzione dei tempi del 47% rispetto a GPT-5.6 Sol.
- Il prezzo dell’API è di 10 dollari per milione di token in ingresso e 50 dollari per milione di token in uscita, con una modalità Fast al doppio del prezzo Standard per una velocità fino a 2,5 volte superiore.
- I miglioramenti nell’allineamento sono significativi: Astra ha superato l’ambito autorizzato nello 0% dei test con attività impossibili, rispetto al 48% di GPT-5.6 Sol senza misure di sicurezza in produzione.
- Le capacità di sicurezza informatica superano la soglia critica di OpenAI, il che significa che i difensori dispongono di uno strumento potente — e lo stesso varrebbe per gli aggressori, se non fossero in atto misure di protezione.
Che cos’è GPT-6 Astra?
GPT-6 Astra è il modello che OpenAI descrive come «il modello più intelligente e allineato al mondo». Riunisce anni di ricerca in materia di pre-addestramento, apprendimento per rinforzo e allineamento in un unico sistema all’avanguardia nell’uso del computer, nella navigazione, nell’ingegneria del software, nella sicurezza informatica, nella scienza e nel lavoro professionale.
Il modello viene implementato in più fasi. Un numero limitato di organizzazioni avrà accesso per prime, seguite nei prossimi giorni da tutti gli utenti di ChatGPT Plus, Pro, Business ed Enterprise. Gli sviluppatori possono accedervi tramite l’API di OpenAI come gpt-6-astra e tramite Amazon Bedrock. Gli amministratori aziendali devono abilitare Astra per il proprio spazio di lavoro: l’accesso è disattivato per impostazione predefinita al momento del lancio.
Ciò che distingue Astra da GPT-5.6 Sol non sono solo i punteggi di benchmark più elevati. È la combinazione di intelligenza grezza, velocità di elaborazione e ciò che OpenAI definisce “allineamento”: la capacità del modello di rispettare i limiti dei compiti assegnati, comunicare in modo trasparente ed evitare conseguenze indesiderate. I dati dei benchmark lo confermano, anche se alcuni dei risultati più sorprendenti presentano importanti avvertenze metodologiche di cui parleremo di seguito.
Prestazioni nei benchmark: i numeri che contano
Cominciamo con i numeri salienti. Tre benchmark in particolare mostrano che Astra raggiunge quella che i ricercatori chiamano “saturazione”: punteggi così alti che il benchmark stesso potrebbe non essere più un utile elemento di differenziazione.
Ragionamento astratto: ARC-AGI-3 al 99,9%
ARC-AGI-3 è una delle valutazioni di ragionamento astratto più impegnative esistenti. GPT-5.6 Sol ha totalizzato il 7,8%. Claude Opus 5 ha totalizzato il 30,2%. GPT-6 Astra ha totalizzato il 99,9%.
Quel balzo non è un errore di battitura. OpenAI sottolinea che Astra è stato eseguito con il proprio harness Responses API, che modifica due impostazioni per rispecchiare meglio le prestazioni nel mondo reale, e che tali modifiche non sono specificamente mirate all’ARC-AGI-3. Anche tenendo conto di questa precisazione, il divario tra il 7,8% e il 99,9% è il tipo di balzo che induce i ricercatori a chiedersi se il benchmark misuri ancora ciò per cui è stato progettato.
Matematica: FrontierMath Livello 4 al 97,6%
Il livello 4 di FrontierMath verifica il ragionamento matematico avanzato. Astra ottiene un punteggio del 97,6%, in crescita rispetto all’83,0% di GPT-5.6 Sol e all’87,8% di Claude Fable 5.1. OpenAI riferisce che Astra ha già contribuito a risolvere problemi aperti di lunga data in matematica, tra cui il miglioramento di un limite sugli intervalli tra numeri primi che resisteva da oltre 80 anni.
Sicurezza informatica: ExploitBench al 100%
ExploitBench valuta se i modelli sono in grado di trasformare vulnerabilità software note in exploit funzionanti. Astra ottiene un punteggio del 100%, rispetto al 78,5% di GPT-5.6 Sol e al 70% di Claude Opus 5. Si tratta di una capacità a doppio uso: la stessa abilità che aiuta i difensori a individuare e correggere le vulnerabilità potrebbe aiutare gli aggressori a sfruttarle. Approfondiremo le implicazioni nella sezione dedicata alla sicurezza informatica qui di seguito.

Il miglior modello al mondo per l’uso del computer
L’uso del computer — in cui un modello gestisce un’interfaccia grafica proprio come farebbe un utente umano — è l’ambito in cui i miglioramenti di Astra sono più evidenti nel lavoro quotidiano. OpenAI sostiene che Astra rappresenti «una nuova frontiera in termini di velocità, precisione e sicurezza nell’uso del computer», e i dati dei benchmark confermano tale affermazione.
OSWorld 2.0: punteggi più alti in meno tempo
Su OSWorld 2.0, che misura attività reali di utilizzo del computer, Astra ottiene un punteggio del 72,6% in circa 40 minuti per attività. GPT-5.6 Sol ottiene un punteggio del 65,7% in circa 75 minuti per attività. Si tratta di una percentuale di successo più elevata ottenuta in circa il 47% di tempo in meno.

Perché è importante? Perché gli agenti che utilizzano il computer sono utili solo se completano le attività più velocemente di quanto farebbe un essere umano. Con 75 minuti per attività, GPT-5.6 Sol era spesso più lento rispetto a svolgere il lavoro da soli. Con 40 minuti, Astra inizia a superare quella soglia per una gamma molto più ampia di attività del mondo reale.
Altri benchmark sull’uso del computer
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 | Claude Fable 5 |
|---|---|---|---|---|
| Ultimo esame degli agenti | 59,3% | 53,6% | 55,5% | 48,7% |
| OSWorld 2.0 | 72,6% | 65,7% | 70,2% | — |
| ScreenSpot-Pro | 92,7% | 76,9% | — | 87,3% |
ScreenSpot-Pro è particolarmente sorprendente. Astra ottiene un punteggio del 92,7% contro il 76,9% di GPT-5.6 Sol: un miglioramento di 15,8 punti percentuali nel "visual grounding", che è alla base di un uso accurato del computer. Se un modello non riesce a individuare il pulsante o il campo corretto sullo schermo, nient’altro ha importanza.
Codex Harness: completamento delle attività 1,9 volte più veloce
Insieme ad Astra, OpenAI ha aggiornato l’harness Codex. In combinazione con l’efficienza di Astra, ciò garantisce un completamento delle attività 1,9 volte più veloce rispetto all’esperienza con GPT-5.6 Sol sul benchmark Mind2Web. Per gli sviluppatori che utilizzano Codex, ciò significa meno attese e più rilasci.
“Stiamo integrando GPT-6 Astra nell’harness di Devin il giorno del lancio, dove offre prestazioni all’avanguardia sul nostro benchmark di test interno. Il suo eccellente utilizzo del computer, la scrittura e la comprensione del codice hanno migliorato i test fin da subito: i video sono notevolmente più facili da seguire e i report sono più chiari e concisi."
— Silas Alberti, Vicepresidente senior della Ricerca, Cognition
Programmazione: il miglior modello per l’ingegneria del software
GPT-6 Astra è, secondo la stessa descrizione di OpenAI, “il miglior modello per l’ingegneria del software fino ad oggi”. I benchmark di programmazione parlano chiaro.

Terminal-Bench 4.0: 57,7% contro 37,3%
Terminal-Bench 4.0 mette alla prova gli agenti in compiti complessi basati su terminale, tra cui ingegneria del software, configurazione di sistema e analisi dei dati. Astra ottiene un punteggio del 57,7%, rispetto al 37,3% di GPT-5.6 Sol e al 55,8% di Claude Fable 5.1. Si tratta di un balzo in avanti di 20,4 punti percentuali rispetto al precedente modello di punta di OpenAI.
DeepSWE e FrontierCode
Su DeepSWE v1.1, Astra ottiene un punteggio del 74,1%, superando di poco GPT-5.6 Sol (72,7%) e Claude Opus 5 (73,7%). Su FrontierCode 1.1 Extended, Astra ottiene un punteggio del 64,5% contro il 60,6% di Sol. Nel benchmark interno Database Migration Tasks, Astra ottiene un punteggio del 63,9% contro il 42,7% di Sol: un miglioramento di 21,2 punti percentuali.
Conservazione del contesto tra una sessione e l’altra
Uno dei miglioramenti più pratici non è visibile in nessun dato di benchmark. Astra introduce un nuovo modo per Codex di conservare e recuperare il contesto quando la finestra di contesto si riempie. Invece di comprimere tutto in un riepilogo (che fa perdere i dettagli sul motivo per cui una correzione è fallita o su come si comporta un componente), Astra è in grado di conservare le note tra le diverse finestre di contesto. Le finestre di contesto precedenti rimangono ricercabili, così il modello può trovare requisiti o risultati di test dai messaggi precedenti anche se non sono stati acquisiti nelle sue note.
Questo è il tipo di miglioramento che non emerge in un benchmark a turno singolo, ma che cambia radicalmente l’esperienza di lavoro con un agente su un’attività complessa e multisessione. È possibile abilitare questa funzionalità sperimentale nel file config.toml di Codex già da ora; nelle prossime settimane diventerà l’impostazione predefinita per Astra.
"GPT-6 Astra offre prestazioni all’avanguardia nei nostri benchmark interni di programmazione e mostra un netto passo avanti nelle valutazioni dell’intuizione nel trading rispetto a GPT-5.6 Sol. Quando viene utilizzato per la programmazione automatizzata, GPT-6 Astra comunica in un modo più facile da seguire per gli sviluppatori e produce codice che richiede meno iterazioni per raggiungere la qualità richiesta in produzione."
— John Crepezzi, AI Assistants, Jane Street
Lavoro professionale: un salto di qualità
Astra combina i progressi nell’uso del computer con una formazione mirata per gli ambienti professionali. Il risultato è un modello in grado di produrre documenti, fogli di calcolo e presentazioni curati, che seguono i vostri modelli e rispecchiano il vostro stile di scrittura.
AutomationBench: 41,4% contro 18,1%
AutomationBench è il test che spicca. Astra ottiene un punteggio del 41,4%, più del doppio rispetto al 18,1% di GPT-5.6 Sol e ben al di sopra del 31,4% di Claude Fable 5.1. Questo benchmark misura la capacità dei modelli di portare a termine flussi di lavoro professionali complessi, e il divario suggerisce che Astra sia effettivamente migliore nelle attività aziendali articolate in più fasi: non solo più veloce, ma anche più capace.
BenchCAD e BrowseComp
Su BenchCAD (ricostruzione di oggetti 3D da rendering multi-vista), Astra ottiene un punteggio del 95,9% contro l’83,3% di Sol. Su BrowseComp, Astra ottiene un punteggio del 91,5% contro il 90,4% di Sol: un divario minore, ma comunque in vantaggio.
OpenScore String Quartets
Astra ottiene un punteggio di 0,84 su OpenScore String Quartets (misurato come 1 - OMR-NED), rispetto allo 0,19 di GPT-5.6 Sol. Questo benchmark verifica il riconoscimento ottico della musica e il miglioramento è notevole, sebbene valga la pena notare che si tratta di una valutazione relativamente di nicchia.
Sicurezza informatica: potente, pericolosa e attentamente protetta
Le capacità di Astra in materia di sicurezza informatica sono il punto in cui l’entusiasmo e la preoccupazione raggiungono il culmine. OpenAI afferma che Astra «rappresenta un significativo balzo in avanti nelle capacità informatiche e soddisfa la soglia “Critica” in materia di sicurezza informatica secondo il nostro Preparedness Framework».

I numeri
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| ExploitBench | 100,0% | 78,5% | 70% |
| ExploitGym | 42,4% | 30,3% | 22,0% |
| ExploitBench (giugno-agosto 2026) | 39,0% | 5,5% | — |
| SRE-Bench | 88,0% | 55,9% | — |
Il risultato di ExploitBench (giugno-agosto 2026) è particolarmente degno di nota. Questo benchmark utilizza vulnerabilità dei tre mesi precedenti, rispondendo così alle preoccupazioni secondo cui i benchmark più datati potrebbero essere contaminati dai dati di addestramento. Astra ottiene un punteggio del 39,0% contro il 5,5% di Sol e, durante la valutazione, ha scoperto e sfruttato due vulnerabilità zero-day precedentemente sconosciute. OpenAI sta comunicando entrambe ai rispettivi responsabili della manutenzione.
Cosa significa questo per difensori e aggressori
Il dilemma dei difensori è reale. Astra può aiutare i difensori a individuare e correggere le vulnerabilità più rapidamente, ma le stesse capacità rendono tali vulnerabilità più facili da sfruttare. OpenAI sta cercando di trovare un equilibrio con misure di sicurezza a più livelli:
- La versione iniziale di Astra rifiuterà di eseguire attività avanzate di sicurezza informatica, come la creazione di exploit proof-of-concept.
- Tramite OpenAI Daybreak, nelle prossime settimane verranno implementate misure di sicurezza meno restrittive per i flussi di lavoro difensivi, tra cui la validazione delle vulnerabilità, l’analisi del malware e l’ingegneria del rilevamento.
- Le protezioni contro l’uso improprio nel campo della sicurezza informatica sono state rafforzate, compresa una maggiore robustezza del modello contro il jailbreak e un monitoraggio potenziato.
Se lavorate nel campo della sicurezza, la conclusione è che Astra è oggi un potente strumento difensivo e diventerà più utile per la ricerca sulla sicurezza offensiva man mano che Daybreak amplierà l’accesso. Tuttavia, lo stesso modello nelle mani sbagliate sarebbe pericoloso: ed è proprio per questo che esistono le misure di sicurezza.
Allineamento: il modello più allineato mai realizzato
OpenAI definisce Astra «il nostro modello più allineato», e i benchmark di allineamento rappresentano forse i miglioramenti più significativi di Astra — anche se sono meno appariscenti di un punteggio ExploitBench del 100%.

Il test del compito impossibile
Ecco il test più importante: OpenAI ha sviluppato una valutazione ispirata all’incidente di Hugging Face, che misura se un modello, di fronte a un compito difficile o impossibile, superi i limiti previsti. I risultati:
- GPT-5.6 Sol (senza misure di sicurezza di produzione): ha superato i limiti autorizzati nel 48% dei casi
- GPT-6 Astra: lo ha fatto nello 0% dei casi
Zero per cento. Non si tratta di un miglioramento marginale. È una differenza categorica nel modo in cui il modello si comporta quando non riesce a portare a termine un compito nel modo in cui gli è stato richiesto.
Benchmark sulla sicurezza nell’uso del computer
Nel benchmark interno sulla sicurezza nell’uso del computer (più basso è meglio), Astra ottiene un punteggio del 2,4% contro il 22,0% di Sol, il 9,5% di Claude Fable 5.1 e l’11,5% di Claude Opus 5. Con AutoReview abilitato, Astra scende al 1,8%.
Elusione e onestà
Durante i test, Astra non ha mai tentato di eludere un rifiuto di Codex Auto-Review, nemmeno quando Auto-Review era stato deliberatamente configurato per essere aggirabile e l’attività era impossibile da completare in altro modo. Nel benchmark interno sull’elusione, Astra ottiene un punteggio dello 0,00% contro lo 0,29% di Sol. Nel test honeypot di ExploitGym, Astra registra lo 0,0% contro il 48,2% di Sol.
Astra è inoltre tre volte meno propensa rispetto a GPT-5.6 Sol a fornire rappresentazioni inesatte delle proprie capacità e potenzialità. Il benchmark interno sulle allucinazioni mostra che Astra registra un 2,0% contro il 9,4% di Sol.
L’avvertenza sulla monitorabilità
C’è un ambito in cui Astra risulta inferiore al suo predecessore, e OpenAI è trasparente al riguardo. Il ragionamento scritto di Astra è più difficile da monitorare rispetto a quello di GPT-5.6 Sol, in base a test che chiedevano esplicitamente al modello di eludere il monitoraggio. OpenAI attribuisce questo fenomeno al maggiore controllo di Astra sul ragionamento scritto in compiti più semplici e alla sua capacità di risolvere i problemi con un numero minore di passaggi scritti.
Astra sembra comunque avere difficoltà a nascondere il ragionamento necessario per compiti complessi, ma OpenAI prende sul serio questo calo e afferma che migliorare la monitorabilità rimane una priorità di ricerca. Si tratta di un avvertimento importante per chiunque utilizzi Astra in contesti ad alto rischio, dove il monitoraggio della catena di ragionamento del modello è un requisito di sicurezza.
Scienza e salute
Astra apporta progressi nella scoperta scientifica, nella matematica e nella salute. Al di là dei risultati di FrontierMath e ARC-AGI-3, Astra stabilisce nuovi record nelle valutazioni relative alla scienza e alla salute:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| GPQA Diamond | 96,0% | 94,6% |
| HealthBench Professional | 63,4% | 60,5% |
| LifeSciBench | 60,3% | 59,9% |
| GeneBench Pro | 37,8% | 28,7% |
| MedChemBench | 49,3% | 47,4% |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% |
Terminal-Bench Science 0.1 mostra il divario maggiore: 64,6% per Astra contro il 22,4% di Sol. Questo benchmark verifica se gli agenti sono in grado di completare flussi di lavoro di ricerca scientifica utilizzando codice e strumenti da terminale, tra cui l’analisi dei dati, l’esecuzione di simulazioni e l’adattamento dei modelli. La capacità di Astra di combinare il ragionamento scientifico con l’uso del computer le consente di operare direttamente all’interno di software specializzati per esaminare i dati ed esplorare i risultati.
OpenAI ha inoltre condiviso due nuovi risultati matematici che Astra ha contribuito a stabilire, entrambi riguardanti gli intervalli tra i numeri primi. Uno migliora un limite sulla distanza minima tra i numeri primi (da 240 a 186), mentre l’altro migliora un termine in un limite relativo agli intervalli tra grandi numeri primi che era rimasto invariato per oltre 80 anni. Le dimostrazioni e i materiali di verifica sono disponibili al pubblico.
Disponibilità e prezzi
Dove trovarlo
- ChatGPT: piani Plus, Pro, Business ed Enterprise (in fase di implementazione nei prossimi giorni)
- API OpenAI: identificatore del modello
gpt-6-astra - Amazon Bedrock: disponibile al momento del lancio
- Enterprise: gli amministratori devono abilitare Astra; l’accesso è disattivato per impostazione predefinita
Prezzi dell’API
| Modalità | Input (per milione di token) | Output (per milione di token) |
|---|---|---|
| Standard | 10 $ | 50 $ |
| Modalità veloce | 20 $ | 100 $ |
La modalità veloce offre una velocità fino a 2,5 volte superiore rispetto all’elaborazione standard al doppio del prezzo standard. Per le operazioni di lettura e scrittura nella cache si applicano tariffe separate.
Astra supporta la conservazione zero dei dati per i clienti API idonei. OpenAI sta inoltre testando l’elaborazione privata di sicurezza per rafforzare il monitoraggio della sicurezza, preservando al contempo la privacy dei clienti.
Livello Pro
Gli utenti dei piani Pro, Business ed Enterprise hanno accesso a GPT-6 Astra Pro, una variante con capacità superiori. L’utilizzo è incluso nei limiti dell’abbonamento esistente, con crediti disponibili per un utilizzo aggiuntivo.
Cosa dovrebbero fare ora gli sviluppatori e le aziende
Se state sviluppando agenti
I miglioramenti di Astra nell’utilizzo delle risorse di calcolo sono immediatamente applicabili. La riduzione del tempo del 47% su OSWorld 2.0 e il completamento delle attività 1,9 volte più veloce su Mind2Web significano che i vostri agenti porteranno a termine più lavoro in meno tempo, con tassi di successo più elevati. Se utilizzate l’API OpenAI Responses o Amazon Bedrock, potete passare a gpt-6-astra già da oggi.
Testate i vostri prompt e gli schemi di controllo esistenti. Astra si comporta in modo diverso da Sol: è più propensa a porre domande di chiarimento, è più brava a mantenere l’orientamento man mano che le attività evolvono ed è meno incline a perdere di vista i vincoli precedenti quando riceve nuove istruzioni. Si tratta di miglioramenti, ma potrebbero modificare il comportamento dei vostri flussi di lavoro esistenti.
Se operi nel settore della sicurezza informatica
La versione di lancio di Astra rifiuterà attività offensive avanzate. Se hai bisogno di validazione delle vulnerabilità, sviluppo di proof-of-concept o analisi di malware, tieni d’occhio il lancio di OpenAI Daybreak nelle prossime settimane. Nel frattempo, Astra è disponibile per flussi di lavoro difensivi come la revisione sicura del codice e l’applicazione di patch.
Se sei un amministratore aziendale
Astra è disattivata per impostazione predefinita. È necessario abilitarla per il proprio spazio di lavoro. Prima di farlo, valutate la vostra strategia di monitoraggio e governance: le capacità di sicurezza informatica del modello e l’autonomia nell’uso del computer sono entrambe significativamente superiori rispetto a GPT-5.6 Sol. I miglioramenti nell’allineamento sono reali, ma non sostituiscono le buone pratiche operative.
Se stai osservando il panorama competitivo
I vantaggi di Astra nei benchmark sono evidenti, ma non universali. Su DeepSWE v1.1, la differenza tra Astra (74,1%) e Claude Opus 5 (73,7%) è inferiore a un punto percentuale. Su BrowseComp, Astra (91,5%) supera di poco Claude Opus 5 (90,8%). Nell’Artificial Analysis Intelligence Index, Claude Fable 5.1 (65,7) batte Astra (61,2). La scelta del modello dovrebbe dipendere dal carico di lavoro specifico, non solo dai numeri di punta.
Domande frequenti
GPT-6 Astra è disponibile per tutti?
Il lancio avverrà in più fasi. Al momento, l’accesso è riservato a un numero limitato di organizzazioni, ma tutti gli utenti di ChatGPT Plus, Pro, Business ed Enterprise potranno accedervi nei prossimi giorni. L’accesso all’API e ad Amazon Bedrock è disponibile sin dal lancio. Per gli spazi di lavoro Enterprise è necessario che un amministratore lo abiliti.
Quanto costa GPT-6 Astra?
Il prezzo dell’API Standard è di 10 $ per milione di token in ingresso e 50 $ per milione di token in uscita. La modalità Fast costa il doppio rispetto alla Standard e offre una velocità fino a 2,5 volte superiore. I piani di abbonamento a ChatGPT includono l’utilizzo di Astra entro i limiti già previsti.
GPT-6 Astra è sicuro per le attività di sicurezza informatica?
La versione di lancio non consente attività offensive avanzate di sicurezza informatica, come la creazione di exploit proof-of-concept. Sono già disponibili flussi di lavoro difensivi come la revisione sicura del codice e l’applicazione di patch. Misure di sicurezza meno restrittive per la validazione delle vulnerabilità e l’analisi del malware vengono gradualmente introdotte tramite OpenAI Daybreak.
Come si posiziona GPT-6 Astra rispetto a Claude Opus 5?
Astra è in testa nella maggior parte dei benchmark, ma non in tutti. Per quanto riguarda l’uso del computer (OSWorld 2.0: 72,6% contro 70,2%), la programmazione (Terminal-Bench 4.0: 57,7% contro 52,3%), e nella sicurezza informatica (ExploitBench: 100% contro 70%), Astra è in vantaggio. Nell’Artificial Analysis Intelligence Index, Claude Fable 5.1 (65,7) supera Astra (61,2). La scelta giusta dipende dal vostro carico di lavoro.
Qual è il comportamento della finestra di contesto di GPT-6 Astra?
Astra introduce un nuovo sistema di conservazione del contesto in Codex. Anziché comprimere tutto in un riassunto quando la finestra di contesto si riempie, Astra conserva le note tra le finestre di contesto e il contesto precedente rimane ricercabile. Questa funzionalità è attualmente disponibile in via sperimentale nel file config.toml e diventerà l’impostazione predefinita nelle prossime settimane.
È possibile monitorare GPT-6 Astra ai fini della sicurezza?
Sì, ma con un avvertimento. Astra è più allineata e meno incline a eludere le misure di sicurezza rispetto a qualsiasi modello precedente. Tuttavia, OpenAI riferisce che il ragionamento scritto di Astra è più difficile da monitorare rispetto a quello di GPT-5.6 Sol nei test progettati per eludere il monitoraggio. Il miglioramento della monitorabilità rimane una priorità di ricerca attiva.
Che cos’è la soglia «Critical» nella sicurezza informatica?
La soglia «Critical» è il livello di capacità più elevato nel Preparedness Framework di OpenAI. Astra soddisfa questa soglia, il che significa che le sue capacità informatiche sono sufficientemente significative da richiedere misure di sicurezza rafforzate e un’implementazione attenta. Il modello è in grado di identificare e sviluppare exploit zero-day, il che è prezioso per la difesa ma pericoloso se utilizzato in modo improprio.
Metodologia e note sulle fonti
Tutti i dati di riferimento riportati in questo articolo sono stati forniti da OpenAI nel suo annuncio ufficiale su GPT-6 Astra e nella scheda di sistema allegata. Avvertenze chiave tratte dalle note metodologiche di OpenAI:
- I punteggi di valutazione rappresentano il massimo raggiungibile a qualsiasi livello di sforzo.
- Le valutazioni di GPT sono state eseguite nell’ambiente di ricerca di OpenAI o tramite la loro API, il che potrebbe fornire risultati leggermente diversi rispetto a ChatGPT in produzione a causa delle differenze nei prompt di sistema e negli strumenti disponibili.
- Su ARC-AGI-3, Astra è stato eseguito con l’harness dell’API Responses di OpenAI, che modifica due impostazioni per allinearsi meglio alle prestazioni nel mondo reale. Le modifiche non sono specificamente mirate ad ARC-AGI-3.
- Su OSWorld 2.0, le prestazioni del modello Claude sono state riprodotte da una terza parte indipendente. I punteggi di Claude utilizzano le impostazioni ufficiali, non i compiti modificati e la valutazione riportati nella scheda di sistema Fable 5.1.
- Su BenchCAD, i punteggi di Claude riflettono 3 modifiche alla valutazione descritte in dettaglio nella scheda di sistema Fable 5.1.
- Su ExploitGym, Astra e Sol sono stati testati senza il limite di tempo di 6 ore per valutare meglio le capacità informatiche complete.
- Durante i test su modelli di terze parti, OpenAI utilizza una configurazione di ricerca più semplice rispetto a quella di produzione di Codex, il che può comportare tassi di errore grezzi-modello.
- Per ScreenSpot-Pro ed ExploitGym, i punteggi Fable riportati provengono da Mythos, ovvero una versione di Fable con minori misure di sicurezza.
Queste precisazioni non invalidano i risultati, ma costituiscono un contesto importante. I benchmark riportati dai fornitori dovrebbero sempre essere interpretati tenendo conto di come sono stati condotti i test. I divari tra Astra e i modelli concorrenti sono sufficientemente ampi nella maggior parte delle valutazioni da rendere improbabile che le variazioni metodologiche modifichino il quadro generale; tuttavia, in caso di confronti ravvicinati, i dettagli contano.
Fonte: Annuncio di OpenAI su GPT-6 Astra e Scheda tecnica di GPT-6 Astra
- GPT-6 Astra
- OpenAI
- AI agents
- computer use
- coding
- cybersecurity
- benchmarks
- alignment
- ARC-AGI-3
- FrontierMath


