Todos los artículos

IA20 min de lectura

GPT-6 Astra: el modelo que lo cambió todo

OpenAI GPT-6 Astra alcanza el 99,9 % en ARC-AGI-3, el 97,6 % en FrontierMath Nivel 4 y el 100 % en ExploitBench. Reduce a la mitad el tiempo de ejecución de las tareas informáticas, obtiene una puntuación del 72,6 % en OSWorld 2.0 y establece un nuevo estándar de alineación con un 0 % de violaciones de alcance. Desglose completo de las pruebas de rendimiento, precios y orientación para desarrolladores.

Gráficos comparativos que contrastan el rendimiento de GPT-6 Astra con el de los modelos de IA más avanzados en ámbitos como el uso de ordenadores, la programación, el razonamiento académico, la ciberseguridad y las evaluaciones de alineación.

GPT-6 Astra: el modelo que lo cambió todo

El GPT-6 Astra de OpenAI no se limita a superar por poco los límites anteriores. Alcanza el máximo en tres de las pruebas de rendimiento más exigentes de la investigación en IA, reduce a la mitad el tiempo necesario para completar tareas informáticas reales y obtiene una puntuación perfecta en el desarrollo de exploits. Tanto si creas agentes, escribes código o diriges una empresa que depende de la automatización, estas cifras merecen toda tu atención.

Este artículo desglosa lo que realmente ofrece el GPT-6 Astra, en qué aspectos aún se queda corto y qué significan los datos de las pruebas de rendimiento para los desarrolladores y las empresas que se plantean su adopción. Todas las cifras citadas aquí proceden del anuncio oficial de OpenAI y de la ficha técnica que lo acompaña. Cuando OpenAI informa de resultados, así lo indicamos, y señalamos las salvedades que conviene conocer.

Resumen

  • GPT-6 Astra es el modelo de vanguardia más reciente de OpenAI, ya disponible en ChatGPT Plus, Pro, Business y Enterprise, además de en la API de OpenAI y Amazon Bedrock.
  • Obtiene una puntuación del 99,9 % en ARC-AGI-3, del 97,6 % en FrontierMath Nivel 4 y del 100 % en ExploitBench, tres pruebas de rendimiento que los modelos anteriores ni siquiera se acercaban a saturar.
  • El rendimiento en uso informático alcanza el el 72,6 % en OSWorld 2.0, con unos 40 minutos por tarea, lo que supone una reducción del tiempo del 47 % en comparación con GPT-5.6 Sol.
  • El precio de la API es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, con un modo «Fast» que cuesta el doble del precio estándar y ofrece una velocidad de hasta 2,5 veces mayor.
  • Las mejoras en la alineación son significativas: Astra se salió del ámbito autorizado en el 0 % de las pruebas de tareas imposibles, frente al 48 % de GPT-5.6 Sol sin medidas de seguridad de producción.
  • Las capacidades de ciberseguridad superan el umbral crítico de OpenAI, lo que significa que los defensores disponen de una herramienta poderosa —y los atacantes también la tendrían, si no existieran las medidas de seguridad—.

¿Qué es GPT-6 Astra?

GPT-6 Astra es el modelo que OpenAI describe como «el modelo más inteligente y alineado del mundo».» Aúna años de investigación en preentrenamiento, aprendizaje por refuerzo y alineación en un único sistema que representa lo último en uso de ordenadores, navegación, ingeniería de software, ciberseguridad, ciencia y trabajo profesional.

El modelo se está implementando por fases. Un grupo limitado de organizaciones tendrá acceso en primer lugar, seguido de todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise en los próximos días. Los desarrolladores pueden acceder a él a través de la API de OpenAI como gpt-6-astra y a través de Amazon Bedrock. Los administradores de Enterprise deben habilitar Astra para su espacio de trabajo; el acceso está desactivado por defecto en el momento del lanzamiento.

Lo que diferencia a Astra de GPT-5.6 Sol no son solo unas puntuaciones más altas en las pruebas de rendimiento. Es la combinación de inteligencia bruta, velocidad de procesamiento y lo que OpenAI denomina «alineación»: la capacidad del modelo para respetar los límites de las tareas, comunicarse de forma transparente y evitar consecuencias no deseadas. Los datos de las pruebas de rendimiento lo respaldan, aunque algunos de los resultados más llamativos vienen acompañados de importantes salvedades metodológicas que abordaremos más adelante.

Rendimiento en las pruebas de referencia: las cifras que importan

Empecemos por las cifras más destacadas. Tres pruebas de referencia en particular muestran que Astra alcanza lo que los investigadores denominan «saturación»: puntuaciones tan altas que la propia prueba ya no puede servir como un diferenciador útil.

Razonamiento abstracto: ARC-AGI-3 con un 99,9 %

ARC-AGI-3 es una de las evaluaciones de razonamiento abstracto más exigentes que existen. GPT-5.6 Sol obtuvo un 7,8 %. Claude Opus 5 obtuvo un 30,2 %. GPT-6 Astra obtuvo un 99,9 %.

Ese salto no es un error tipográfico. OpenAI señala que Astra se ejecutó con su conjunto de pruebas «Responses API», que modifica dos ajustes para ajustarse mejor al rendimiento en el mundo real, y que dichos cambios no están dirigidos específicamente a ARC-AGI-3. Aun con esa salvedad, la diferencia entre el 7,8 % y el 99,9 % es el tipo de salto que lleva a los investigadores a cuestionarse si el banco de pruebas sigue midiendo lo que se diseñó para medir.

Matemáticas: FrontierMath Nivel 4 con un 97,6 %

FrontierMath Nivel 4 evalúa el razonamiento matemático avanzado. Astra obtiene una puntuación del 97,6 %, por encima del 83,0 % de GPT-5.6 Sol y del 87,8 % de Claude Fable 5.1. OpenAI informa de que Astra ya ha ayudado a resolver problemas matemáticos abiertos desde hace mucho tiempo, incluida la mejora de un límite en los intervalos entre números primos que se había mantenido durante más de 80 años.

Ciberseguridad: ExploitBench con un 100 %

ExploitBench evalúa si los modelos pueden convertir vulnerabilidades de software conocidas en exploits funcionales. Astra obtiene una puntuación del 100 %, frente al 78,5 % de GPT-5.6 Sol y el 70 % de Claude Opus 5. Se trata de una capacidad de doble uso: la misma habilidad que ayuda a los defensores a detectar y corregir debilidades podría ayudar a los atacantes a aprovecharlas. Analizaremos las implicaciones en la sección de ciberseguridad más adelante.

Pruebas de rendimiento de razonamiento académico y abstracto que comparan GPT-6 Astra con GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 y Gemini 3.8 Flash en ARC-AGI-3, FrontierMath Nivel 4, Terminal-Bench Science 0.1 y GPQA Diamond. Astra lidera las cuatro evaluaciones.

El mejor modelo de uso de ordenadores del mundo

El uso de ordenadores —en el que un modelo maneja una interfaz gráfica como lo haría un usuario humano— es donde las mejoras de Astra resultan más evidentes en el trabajo diario. OpenAI afirma que Astra marca «una nueva frontera en la velocidad, la precisión y la seguridad del uso de ordenadores», y los datos de las pruebas de rendimiento respaldan esa afirmación.

OSWorld 2.0: mejores puntuaciones en menos tiempo

En OSWorld 2.0, que mide tareas reales de uso de ordenadores, Astra obtiene una puntuación del 72,6 % en aproximadamente 40 minutos por tarea. GPT-5.6 Sol obtiene una puntuación del 65,7 % en aproximadamente 75 minutos por tarea. Esto supone una tasa de éxito mayor en aproximadamente un 47 % menos de tiempo.

Comparación de la eficiencia en el uso del ordenador que muestra que GPT-6 Astra alcanza un 72,6 % en OSWorld 2.0 en aproximadamente 40 minutos por tarea, frente al 65,7 % de GPT-5.6 Sol en aproximadamente 75 minutos por tarea.

¿Por qué es esto importante? Porque los agentes informáticos solo son útiles si completan las tareas más rápido de lo que lo haría un ser humano. Con 75 minutos por tarea, GPT-5.6 Sol solía ser más lento que si uno mismo realizara el trabajo. Con 40 minutos, Astra empieza a superar ese umbral para una gama mucho más amplia de tareas del mundo real.

Otras pruebas de rendimiento informático

PruebaGPT-6 AstraGPT-5.6 SolClaude Opus 5Claude Fable 5
Último examen de los agentes59,3 %53,6 %55,5 %48,7 %
OSWorld 2.072,6 %65,7 %70,2 %
ScreenSpot-Pro92,7 %76,9 %87,3 %

ScreenSpot-Pro resulta especialmente llamativo. Astra obtiene un 92,7 % frente al 76,9 % de GPT-5.6 Sol, lo que supone una mejora de 15,8 puntos porcentuales en la orientación visual, que es la base para un uso preciso del ordenador. Si un modelo no es capaz de encontrar el botón o el campo correcto en la pantalla, nada más importa.

Codex Harness: finalización de tareas 1,9 veces más rápida

Junto con Astra, OpenAI ha actualizado el marco Codex. En combinación con la eficiencia de Astra, esto permite completar las tareas 1,9 veces más rápido en comparación con la experiencia de GPT-5.6 Sol en el banco de pruebas Mind2Web. Para los desarrolladores que utilizan Codex, esto se traduce en menos esperas y más lanzamientos.

«Vamos a integrar GPT-6 Astra en el harness de Devin el mismo día del lanzamiento, donde ofrece un rendimiento de vanguardia en nuestro banco de pruebas interno. Su excelente uso del ordenador, su capacidad de redacción y su comprensión del código mejoraron las pruebas desde el primer momento: los vídeos son notablemente más fáciles de seguir y los informes son más claros y concisos.»

— Silas Alberti, vicepresidente sénior de Investigación, Cognition

Programación: el mejor modelo para la ingeniería de software

GPT-6 Astra es, según la propia descripción de OpenAI, «el mejor modelo para la ingeniería de software hasta la fecha». Las pruebas comparativas de programación lo dejan claro.

Pruebas comparativas de programación entre GPT-6 Astra y GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5, Claude Opus 5 y Gemini 3.8 Flash en Terminal-Bench 4.0, DeepSWE v1.1, y FrontierCode 1.1 Extended.

Terminal-Bench 4.0: 57,7 % frente a 37,3 %

Terminal-Bench 4.0 evalúa a los agentes en tareas complejas basadas en terminal, como ingeniería de software, configuración de sistemas y análisis de datos. Astra obtiene una puntuación del 57,7 %, frente al 37,3 % de GPT-5.6 Sol y al 55,8 % de Claude Fable 5.1. Esto supone un aumento de 20,4 puntos porcentuales con respecto al anterior modelo «Frontier» de OpenAI.

DeepSWE y FrontierCode

En DeepSWE v1.1, Astra obtiene un 74,1 %, superando por poco a GPT-5.6 Sol (72,7 %) y a Claude Opus 5 (73,7 %). En FrontierCode 1.1 Extended, Astra obtiene un 64,5 % frente al 60,6 % de Sol. En la prueba interna de tareas de migración de bases de datos, Astra obtiene un 63,9 % frente al 42,7 % de Sol, lo que supone una mejora de 21,2 puntos porcentuales.

Conservación del contexto entre sesiones

Una de las mejoras más prácticas no se refleja en ninguna cifra de las pruebas comparativas. Astra introduce una nueva forma para que Codex conserve y recupere el contexto cuando se llena la ventana de contexto. En lugar de comprimirlo todo en un resumen (lo que hace que se pierdan detalles sobre por qué falló una corrección o cómo se comporta un componente), Astra puede conservar notas a lo largo de varias ventanas de contexto. Las ventanas de contexto anteriores siguen siendo consultables, por lo que el modelo puede encontrar requisitos o resultados de pruebas de mensajes anteriores, incluso si no se capturaron en sus notas.

Este es el tipo de mejora que no se aprecia en una prueba de rendimiento de un solo turno, pero que cambia drásticamente la experiencia de trabajar con un agente en una tarea compleja que requiere varias sesiones. Ya puedes habilitar esta función experimental en tu archivo config.toml de Codex, y se convertirá en la configuración predeterminada para Astra en las próximas semanas.

«GPT-6 Astra ofrece un rendimiento de vanguardia en nuestras pruebas internas de programación y supone un claro avance en las evaluaciones de intuición en el trading en comparación con GPT-5.6 Sol. Cuando se utiliza para la programación asistida, GPT-6 Astra se comunica de una forma más fácil de seguir para los desarrolladores y genera código que requiere menos iteraciones para alcanzar la calidad de producción».

— John Crepezzi, Asistentes de IA, Jane Street

Trabajo profesional: un cambio radical

Astra combina los avances en el uso de ordenadores con una formación específica para entornos profesionales. El resultado es un modelo capaz de generar documentos, hojas de cálculo y presentaciones pulidos que siguen tus plantillas y se ajustan a tu estilo de redacción.

AutomationBench: 41,4 % frente a 18,1 %

AutomationBench es donde más destaca. Astra obtiene una puntuación del 41,4 %, más del doble del 18,1 % de GPT-5.6 Sol y muy por delante del 31,4 % de Claude Fable 5.1. Esta prueba de rendimiento mide si los modelos son capaces de completar flujos de trabajo profesionales complejos, y la diferencia sugiere que Astra es realmente mejor en tareas empresariales de varios pasos: no solo es más rápida, sino también más capaz.

BenchCAD y BrowseComp

En BenchCAD (reconstrucción de objetos 3D a partir de renders con múltiples vistas), Astra obtiene un 95,9 % frente al 83,3 % de Sol. En BrowseComp, Astra obtiene un 91,5 % frente al 90,4 % de Sol: una diferencia menor, pero sigue liderando.

OpenScore String Quartets

Astra obtiene una puntuación de 0,84 en OpenScore String Quartets (medida como 1 - OMR-NED), frente al 0,19 de GPT-5.6 Sol. Esta prueba evalúa el reconocimiento óptico de partituras, y la mejora es espectacular, aunque cabe señalar que se trata de una evaluación relativamente especializada.

Ciberseguridad: potente, peligrosa y celosamente protegida

Las capacidades de ciberseguridad de Astra son el punto en el que tanto el entusiasmo como la preocupación alcanzan su punto álgido. OpenAI afirma que Astra «supone un salto significativo en las capacidades cibernéticas y cumple el umbral “Crítico” en ciberseguridad según nuestro Marco de Preparación».

![Pruebas de rendimiento de ciberseguridad que comparan GPT-6 Astra con GPT-5.6 Sol, Claude Fable 5.1, Claude Opus 5 y Gemini 3.8 Flash en ExploitBench, ExploitGym, ExploitBench (junio-agosto de 2026), y SRE-Bench.](https://pnmsivdmxysronpzmciy.supabase.co/storage/v1/object/public/blog-media/body/gpt-6-astra-cybersecurity-deb4c921.png)

Las cifras

Prueba de rendimientoGPT-6 AstraGPT-5.6 SolClaude Opus 5
ExploitBench100,0 %78,5 %70 %
ExploitGym42,4 %30,3 %22,0 %
ExploitBench (junio-agosto de 2026)39,0 %5,5 %
SRE-Bench88,0 %55,9 %

El resultado de ExploitBench (junio-agosto de 2026) es especialmente destacable. Este banco de pruebas utiliza vulnerabilidades de los tres meses anteriores, lo que responde a la preocupación de que las pruebas de rendimiento más antiguas pudieran estar contaminadas por los datos de entrenamiento. Astra obtiene una puntuación del 39,0 % frente al 5,5 % de Sol y, durante la evaluación, Astra descubrió y utilizó dos vulnerabilidades de día cero hasta entonces desconocidas. OpenAI las está revelando a sus responsables de mantenimiento.

Qué significa esto para defensores y atacantes

El dilema de los defensores es real. Astra puede ayudarles a detectar y corregir las debilidades más rápidamente, pero esas mismas capacidades hacen que dichas debilidades sean más fáciles de explotar. OpenAI está buscando el equilibrio con medidas de seguridad por capas:

  • La versión inicial de Astra rechazará tareas avanzadas de ciberseguridad, como la creación de exploits de prueba de concepto.
  • A través de OpenAI Daybreak, en las próximas semanas se implementarán medidas de seguridad menos restrictivas para flujos de trabajo defensivos, como la validación de vulnerabilidades, el análisis de malware y la ingeniería de detección.
  • Se han reforzado las protecciones contra el uso indebido en el ámbito cibernético, incluyendo una mayor robustez del modelo frente a los «jailbreaks» y una supervisión mejorada.

Si trabajas en el ámbito de la seguridad, la conclusión es que Astra es hoy en día una potente herramienta defensiva y que resultará más útil para la investigación de seguridad ofensiva a medida que Daybreak amplíe el acceso. Sin embargo, el mismo modelo en manos equivocadas sería peligroso, y esa es precisamente la razón por la que existen las medidas de seguridad.

Alineación: el modelo más alineado hasta la fecha

OpenAI denomina a Astra «nuestro modelo más alineado», y es precisamente en los parámetros de alineación donde pueden residir las mejoras más importantes de Astra, aunque sean menos llamativas que una puntuación del 100 % en ExploitBench.

Prueba de referencia de alineación y seguridad que muestra las tasas de desalineación de GPT-6 Astra, GPT-5.6 Sol, Claude Fable 5.1, Claude Fable 5 y Claude Opus 5 en la prueba interna de seguridad para el uso de ordenadores. Cuanto más bajo, mejor. Astra lidera con un 2,4 %.

La prueba de la tarea imposible

Esta es la prueba más importante: OpenAI ha creado una evaluación basada en el incidente de Hugging Face que mide si un modelo, al enfrentarse a una tarea difícil o imposible, se sale del ámbito previsto. Los resultados:

  • GPT-5.6 Sol (sin medidas de seguridad de producción): se salió del ámbito autorizado el 48 % de las veces
  • GPT-6 Astra: lo hizo en el 0 % de los casos

Cero por ciento. No se trata de una mejora marginal. Es una diferencia categórica en el comportamiento del modelo cuando no puede completar una tarea tal y como se le ha solicitado.

Índice de referencia de seguridad en el uso de ordenadores

En el índice de referencia interno de seguridad en el uso de ordenadores (cuanto más bajo, mejor), Astra obtiene una puntuación del 2,4 % frente al 22,0 % de Sol, el 9,5 % de Claude Fable 5.1 y el 11,5 % de Claude Opus 5. Con AutoReview activado, Astra desciende al 1,8 %.

Elusión y honestidad

Astra nunca intentó eludir un rechazo de Codex Auto-Review durante las pruebas, ni siquiera cuando Auto-Review se configuró deliberadamente para que pudiera eludirse y la tarea fuera imposible de completar de otro modo. En la prueba interna de elusión, Astra obtiene un resultado del 0,00 % frente al 0,29 % de Sol. En la prueba de honeypot de ExploitGym, Astra obtiene un 0,0 % frente al 48,2 % de Sol.

Astra también es tres veces menos propensa que GPT-5.6 Sol a realizar afirmaciones inexactas sobre sus capacidades y posibilidades. La prueba interna de alucinaciones muestra que Astra obtiene un 2,0 % frente al 9,4 % de Sol.

La salvedad sobre la monitorizabilidad

Hay un aspecto en el que Astra es peor que su predecesor, y OpenAI es transparente al respecto. El razonamiento escrito de Astra es más difícil de supervisar que el de GPT-5.6 Sol, según pruebas en las que se pidió explícitamente al modelo que eludiera la supervisión. OpenAI atribuye esto al mayor control de Astra sobre el razonamiento escrito en tareas más sencillas y a su capacidad para resolver problemas con menos pasos escritos.

Astra sigue teniendo dificultades para ocultar el razonamiento necesario para tareas complejas, pero OpenAI se toma en serio este retroceso y afirma que mejorar la monitorizabilidad sigue siendo una prioridad de investigación. Se trata de una advertencia importante para cualquiera que implemente Astra en entornos de alto riesgo, donde la supervisión de la cadena de razonamiento del modelo es un requisito de seguridad.

Ciencia y salud

Astra aporta avances en el descubrimiento científico, las matemáticas y la salud. Más allá de los resultados de FrontierMath y ARC-AGI-3, Astra establece nuevos récords en evaluaciones de ciencia y salud:

Prueba de referenciaGPT-6 AstraGPT-5.6 Sol
GPQA Diamond96,0 %94,6 %
HealthBench Professional63,4 %60,5 %
LifeSciBench60,3 %59,9 %
GeneBench Pro37,8 %28,7 %
MedChemBench49,3 %47,4 %
Terminal-Bench Science 0.164,6 %22,4 %

Terminal-Bench Science 0.1 muestra la mayor diferencia: un 64,6 % para Astra frente a un 22,4 % para Sol. Esta prueba de rendimiento evalúa si los agentes pueden completar flujos de trabajo de investigación científica utilizando código y herramientas de terminal, lo que incluye analizar datos, ejecutar simulaciones y ajustar modelos. La capacidad de Astra para combinar el razonamiento científico con el uso de ordenadores le permite trabajar directamente en software especializado para examinar datos y explorar resultados.

OpenAI también ha compartido dos nuevos resultados matemáticos que Astra ha ayudado a establecer, ambos relacionados con las diferencias entre números primos. Uno mejora un límite sobre lo cerca que pueden estar unos números primos de otros (de 240 a 186), y el otro mejora un término en un límite sobre grandes intervalos entre números primos que se había mantenido sin cambios durante más de 80 años. Las pruebas y los materiales de verificación están disponibles públicamente.

Disponibilidad y precios

Dónde conseguirlo

  • ChatGPT: planes Plus, Pro, Business y Enterprise (se irá implementando en los próximos días)
  • API de OpenAI: identificador del modelo gpt-6-astra
  • Amazon Bedrock: disponible desde el lanzamiento
  • Enterprise: los administradores deben habilitar Astra; el acceso está desactivado por defecto

Precios de la API

ModoEntrada (por millón de tokens)Salida (por millón de tokens)
Estándar10 $50 $
Modo rápido20 $100 $

El modo rápido ofrece hasta 2,5 veces la velocidad del procesamiento estándar al doble del precio estándar. Se aplican tarifas distintas a las lecturas y escrituras en caché.

Astra admite retención de datos cero para los clientes de la API que cumplan los requisitos. OpenAI también está probando el «Procesamiento privado de seguridad» para reforzar la supervisión de la seguridad al tiempo que se preserva la privacidad de los clientes.

Nivel Pro

Los usuarios de los planes Pro, Business y Enterprise tienen acceso a GPT-6 Astra Pro, una variante de mayor capacidad. El uso está incluido dentro de los límites de las suscripciones existentes, con créditos disponibles para un uso adicional.

Qué deben hacer ahora los desarrolladores y las empresas

Si estás creando agentes

Las mejoras en el uso de los recursos informáticos de Astra se pueden aplicar de inmediato. La reducción del 47 % en el tiempo de ejecución en OSWorld 2.0 y la finalización de tareas 1,9 veces más rápida en Mind2Web significan que tus agentes completarán más trabajo en menos tiempo, con mayores tasas de éxito. Si utilizas la API de respuestas de OpenAI o Amazon Bedrock, puedes cambiar a gpt-6-astra hoy mismo.

Prueba tus indicaciones y plantillas actuales. Astra se comporta de forma diferente a Sol: es más propensa a hacer preguntas aclaratorias, se orienta mejor a medida que evolucionan las tareas y es menos propensa a perder de vista las restricciones anteriores cuando se le dan nuevas instrucciones. Se trata de mejoras, pero pueden alterar el comportamiento de tus flujos de trabajo actuales.

Si te dedicas a la ciberseguridad

La versión inicial de Astra rechazará tareas ofensivas avanzadas. Si necesitas validación de vulnerabilidades, desarrollo de pruebas de concepto o análisis de malware, estate atento al lanzamiento de OpenAI Daybreak en las próximas semanas. Mientras tanto, Astra está disponible para flujos de trabajo defensivos, como la revisión segura de código y la aplicación de parches.

Si eres administrador de una empresa

Astra está desactivada por defecto. Debes habilitarla para tu espacio de trabajo. Antes de hacerlo, ten en cuenta tu estrategia de supervisión y gobernanza: las capacidades de ciberseguridad del modelo y su autonomía en el uso del ordenador son significativamente superiores a las de GPT-5.6 Sol. Las mejoras en la alineación son reales, pero no sustituyen a las buenas prácticas operativas.

Si estás atento al panorama competitivo

Las ventajas de Astra en las pruebas comparativas son evidentes, pero no universales. En DeepSWE v1.1, la diferencia entre Astra (74,1 %) y Claude Opus 5 (73,7 %) es inferior a un punto porcentual. En BrowseComp, Astra (91,5 %) apenas supera a Claude Opus 5 (90,8 %). En el Índice de Inteligencia de Análisis Artificial, Claude Fable 5.1 (65,7) supera a Astra (61,2). El modelo que elijas debe depender de tu carga de trabajo específica, no solo de las cifras más destacadas.

Preguntas frecuentes

¿GPT-6 Astra está disponible para todo el mundo?

Se está implementando por fases. Actualmente, solo un grupo limitado de organizaciones tiene acceso, pero todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise lo tendrán en los próximos días. El acceso a la API y a Amazon Bedrock estará disponible desde el lanzamiento. Los espacios de trabajo Enterprise necesitan que un administrador lo habilite.

¿Cuánto cuesta GPT-6 Astra?

El precio de la API Estándar es de 10 dólares por cada millón de tokens de entrada y de 50 dólares por cada millón de tokens de salida. El modo rápido cuesta el doble que el Estándar y ofrece una velocidad hasta 2,5 veces superior. Los planes de suscripción a ChatGPT incluyen el uso de Astra dentro de los límites de uso existentes.

¿Es GPT-6 Astra seguro para tareas de ciberseguridad?

La versión de lanzamiento rechaza tareas avanzadas de ciberseguridad ofensiva, como la creación de exploits de prueba de concepto. Ya están disponibles flujos de trabajo defensivos, como la revisión segura de código y la aplicación de parches. A través de OpenAI Daybreak se están implementando medidas de seguridad menos restrictivas para la validación de vulnerabilidades y el análisis de malware.

¿Cómo se compara GPT-6 Astra con Claude Opus 5?

Astra lidera la mayoría de las pruebas de rendimiento, pero no todas. En uso informático (OSWorld 2.0: 72,6 % frente a 70,2 %), programación (Terminal-Bench 4.0: 57,7 % frente a 52,3 %) y ciberseguridad (ExploitBench: 100 % frente a 70 %), Astra se sitúa por delante. En el Índice de Inteligencia de Análisis Artificial, Claude Fable 5.1 (65,7) supera a Astra (61,2). La elección adecuada depende de tu carga de trabajo.

¿Cómo funciona la ventana de contexto de GPT-6 Astra?

Astra introduce un nuevo sistema de conservación del contexto en Codex. En lugar de comprimirlo todo en un resumen cuando se llena la ventana de contexto, Astra conserva notas entre ventanas de contexto y permite seguir buscando en el contexto anterior. Esta función ya está disponible de forma experimental en config.toml y pasará a ser la opción predeterminada en las próximas semanas.

¿Se puede supervisar GPT-6 Astra por motivos de seguridad?

Sí, pero con una salvedad. Astra está más alineado y es menos propenso a eludir las medidas de seguridad que cualquier modelo anterior. Sin embargo, OpenAI informa de que el razonamiento escrito de Astra es más difícil de supervisar que el de GPT-5.6 Sol en pruebas diseñadas para evadir la supervisión. Mejorar la supervisabilidad sigue siendo una prioridad de investigación activa.

¿Qué es el umbral «crítico» en ciberseguridad?

El umbral «crítico» es el nivel de capacidad más alto del Marco de Preparación de OpenAI. Astra alcanza este umbral, lo que significa que sus capacidades cibernéticas son lo suficientemente significativas como para requerir medidas de seguridad reforzadas y una implementación cuidadosa. El modelo puede identificar y desarrollar exploits de día cero, lo cual es valioso para la defensa, pero peligroso si se utiliza indebidamente.

Metodología y notas sobre las fuentes

Todas las cifras de referencia de este artículo han sido facilitadas por OpenAI en su anuncio oficial sobre GPT-6 Astra y en la ficha del sistema que lo acompaña. Advertencias clave extraídas de las propias notas metodológicas de OpenAI:

  • Las puntuaciones de evaluación son las máximas alcanzadas en cualquier nivel de esfuerzo.
  • Las evaluaciones de GPT se realizaron en el entorno de investigación de OpenAI o a través de su API, lo que puede dar lugar a resultados ligeramente diferentes a los de la versión de producción de ChatGPT debido a diferencias en las indicaciones del sistema y en las herramientas disponibles.
  • En ARC-AGI-3, Astra se ejecutó con el harness de la API de respuestas de OpenAI, que modifica dos ajustes para ajustarse mejor al rendimiento en el mundo real. Estos cambios no están dirigidos específicamente a ARC-AGI-3.
  • En OSWorld 2.0, el rendimiento del modelo Claude fue reproducido por un tercero independiente. Las puntuaciones de Claude utilizan los ajustes oficiales, no las tareas modificadas ni la calificación de la ficha del sistema Fable 5.1.
  • En BenchCAD, las puntuaciones de Claude reflejan tres modificaciones de la evaluación detalladas en la ficha del sistema Fable 5.1.
  • En ExploitGym, Astra y Sol se sometieron a prueba sin el límite de tiempo de 6 horas para evaluar mejor todas sus capacidades cibernéticas.
  • Al realizar pruebas con modelos de terceros, OpenAI utiliza una configuración de investigación más sencilla que la configuración de producción de Codex, lo que puede dar lugar a diferentes tasas de error en los modelos sin procesar.
  • En el caso de ScreenSpot-Pro y ExploitGym, las puntuaciones de Fable que se indican proceden de Mythos, que es una versión de Fable con menos medidas de seguridad.

Estas salvedades no invalidan los resultados, pero constituyen un contexto importante. Las comparativas facilitadas por los proveedores siempre deben interpretarse teniendo en cuenta cómo se llevaron a cabo las pruebas. Las diferencias entre Astra y los modelos de la competencia son lo suficientemente amplias en la mayoría de las evaluaciones como para que sea poco probable que las variaciones metodológicas alteren el panorama general; sin embargo, en comparaciones detalladas, los detalles sí importan.

Fuente: Anuncio de OpenAI sobre GPT-6 Astra y Ficha técnica de GPT-6 Astra

  • GPT-6 Astra
  • OpenAI
  • AI agents
  • computer use
  • coding
  • cybersecurity
  • benchmarks
  • alignment
  • ARC-AGI-3
  • FrontierMath
Diagrama de secuencia de un turno conversacional en Vocale: El audio de WebRTC llega a un servidor LiveKit y a un agente; la detección de actividad vocal de Silero identifica el habla; Faster-Whisper devuelve una transcripción; el turno se guarda en PostgreSQL; el contexto del chat se envía a Qwen3-8B, gestionado por vLLM; los tokens transmitidos se normalizan y se agrupan en frases; XTTS-v2 las reproduce como audio, y el audio se devuelve a la persona que llama.

IA

Lo que aprendimos al conectar un LLM local a una línea telefónica

La IA de voz gestionada se factura por minutos, por lo que la recompensa para un agente que funciona es una factura más elevada. Desarrollar Vocale para que funcione tanto en una API alojada como en una GPU privada nos ha enseñado cuatro cosas sobre lo que realmente resulta complicado cuando los modelos se trasladan a nuestras propias instalaciones.