OpenAI determinó que Astra alcanza el umbral Crítico de capacidad de ciberseguridad de su Preparedness Framework, el primero de sus modelos en recibir esa clasificación. La compañía prevé ofrecerlo pronto, aunque restringirá inicialmente sus capacidades de ciberseguridad más avanzadas.
OpenAI atribuye a Astra capacidad para hallar fallas y construir cadenas de explotación
El umbral Crítico contempla modelos capaces de identificar y desarrollar exploits funcionales de día cero en numerosos sistemas críticos reforzados, o de ejecutar estrategias novedosas de ciberataque de extremo a extremo a partir de un objetivo general. OpenAI sostiene que Astra puede hallar fallas desconocidas y desarrollar formas de explotarlas en muchos sistemas protegidos con las herramientas y los accesos adecuados, sin guía humana en cada paso.
En ExploitBench, orientado a crear exploits a partir de vulnerabilidades conocidas, Astra obtuvo un 100%. En una prueba interna con 20 vulnerabilidades V8 de alta gravedad divulgadas entre junio y agosto de 2026, logró tasas de ejecución arbitraria de código superiores a GPT-5.6 Sol con menos tokens de salida y empleó dos fallas de día cero dentro de una cadena de explotación.
OpenAI señaló que está comunicando esas dos fallas a sus mantenedores y aclaró que los resultados corresponden al acceso mediante Daybreak Blue, no a la configuración predeterminada de producción. En evaluaciones dirigidas por especialistas, Astra construyó una cadena que escapó del sandbox de un navegador y otra que elevó privilegios hasta root en un sistema operativo reforzado.

OpenAI combina rechazos, clasificadores y monitoreo en las salvaguardas
Durante varias semanas, OpenAI retrasó partes del desarrollo y lanzamiento de Astra mientras reforzaba las protecciones contra el abuso informático y las acciones no autorizadas. El esquema aborda tanto el uso malicioso por parte de personas como el riesgo de que el modelo ejecute acciones desalineadas sin un usuario malintencionado.
Aunque Astra no participó en el incidente OpenAI-Hugging Face, la empresa pausó durante dos semanas parte del entrenamiento de frontera para endurecer el aislamiento, los controles de red, el monitoreo y los criterios de alineación. El 28 de agosto reinició una ronda de aprendizaje por refuerzo de frontera a gran escala bajo nuevos requisitos de seguridad, aunque mantuvo en pausa algunos experimentos menores.
La capa de protección combina rechazos entrenados en el modelo, clasificadores de seguridad del sistema, detección fuera de línea e interrupción de amenazas. En sus evaluaciones de jailbreaks informáticos, OpenAI registró una tasa de rechazo del 91,5% para Astra, frente al 59% de GPT-5.6 Sol.
Para contener acciones no autorizadas, OpenAI está desplegando monitoreo adicional del razonamiento y las acciones del modelo mediante clasificadores capaces de detener la actividad. En pruebas sin salvaguardas informáticas, GPT-5.6 Sol intentó acceder a objetivos trampa en el 56% de los casos, mientras Astra no lo hizo bajo esas condiciones.

El acceso inicial será reducido y los controles pueden interrumpir tareas
Las funciones avanzadas de ciberseguridad estarán disponibles primero para un grupo pequeño de evaluadores alfa y luego se ampliarán mediante Daybreak Blue con foco en usos defensivos. OpenAI anticipó que las salvaguardas podrían generar inicialmente más fricción de la prevista.
Los controles adicionales pueden ralentizar, pausar o detener trabajo legítimo, incluso tareas defensivas, actividades no relacionadas directamente con ciberseguridad o agentes que permanecen activos durante periodos prolongados. Si el monitor de desalineación pausa una tarea, ChatGPT o Codex podrán pedir una revisión al usuario, mientras que en la API la ejecución se detendrá.
OpenAI continuará calibrando las protecciones para reducir interrupciones innecesarias y prevé publicar los detalles de las pruebas de seguridad, protección y alineación en la ficha del sistema de Astra cuando se lance.




