OpenAI lanza GPT-6 Astra con capacidades críticas de ciberseguridad
Daybreak apoyará a defensores de servicios esenciales con recursos limitados.

OpenAI lanza GPT-6 Astra con capacidades críticas de ciberseguridad

OpenAI lanzó GPT-6 Astra, su primer modelo clasificado en el nivel crítico de capacidad de ciberseguridad bajo su Preparedness Framework. La empresa acompañó el despliegue con controles adicionales y reconoció que el avance reduce la capacidad de supervisar su razonamiento en escenarios adversariales.

OpenAI clasifica a Astra en el nivel crítico y restringirá sus capacidades avanzadas de ciberseguridad
Astra alcanza el umbral crítico por hallar fallas y crear exploits. OpenAI limita el acceso a capacidades avanzadas y refuerza controles de seguridad.

Astra puede investigar vulnerabilidades con mayor autonomía

La clasificación crítica indica que el modelo puede identificar fallas desconocidas y desarrollar métodos para explotarlas en sistemas protegidos, con las herramientas y el acceso adecuados, sin que una persona dirija cada paso. OpenAI sostuvo que Astra supera a GPT-5.6 Sol tanto en eficiencia de tokens como en identificación de vulnerabilidades y desarrollo de exploits.

La evaluación combinó pruebas públicas y privadas con análisis de especialistas. OpenAI utilizó ExploitBench, ExploitGym, SEC-Bench Pro y SRE-Bench, además de dos evaluaciones internas, ensayos sobre navegadores y sistemas operativos reforzados, y pruebas externas encargadas al laboratorio de seguridad Irregular.

Los riesgos considerados incluyen la creación de un exploit propagable contra sistemas ampliamente utilizados, la interrupción de infraestructura crítica y una intrusión grave en sistemas financieros internacionales. OpenAI evaluó tanto el posible abuso por parte de usuarios como las acciones dañinas que el modelo pudiera iniciar sin autorización.

OpenAI detalla usos de agentes en onboarding, cuentas e integraciones
OpenAI explica cómo las empresas Basis, Clay y Exa Labs usan agentes en onboarding, gestión de cuentas y oportunidades de integración para equipos TI.

El despliegue incorpora controles, pero mantiene límites de supervisión

Las medidas aplicadas incluyen mayor aislamiento interno, cifrado de checkpoints, monitoreo de trayectorias completas y una evaluación de alineación obligatoria antes del uso interno. Para el acceso externo, OpenAI añadió monitoreo de desalineación a las inferencias de Astra que utilizan herramientas y ajustó los límites de rechazo para cuentas consideradas de mayor riesgo.

Según la empresa, Astra ofrece mayor resistencia que GPT-5.6 Sol frente a jailbreaks e inyecciones de prompts. En una simulación con más de 54.000 tareas internas de Codex, recibió aproximadamente la mitad de alertas por conductas desalineadas de mayor gravedad.

OpenAI y otras 127 organizaciones piden reforzar la ciberdefensa ante ataques con IA
Empresas, gobiernos y proveedores tecnológicos deben priorizar servicios vitales, ampliar defensas con IA y verificar correcciones ante nuevos riesgos

OpenAI determinó que Astra controla mejor su propia cadena de pensamiento y puede ocultar una degradación deliberada de rendimiento o evadir algunos monitores cuando se le instruye para hacerlo en pruebas adversariales. No encontró evidencia de razonamiento esteganográfico, pero señaló que estos resultados refuerzan la necesidad de desarrollar métodos de auditoría que no dependan exclusivamente de observar la cadena de pensamiento.