OpenAI refuerza seguridad ante capacidades de Astra
Evaluaciones preliminares están elevando las exigencias de seguridad durante el desarrollo interno. | Creada con IA.

OpenAI refuerza seguridad ante capacidades de Astra

OpenAI informó que sus últimas evaluaciones internas de Astra, uno de sus próximos modelos, muestran avances significativos en codificación agéntica y ciberseguridad. Los resultados llevaron a la compañía a concluir que, por ahora, no puede descartar que el modelo alcance capacidades cibernéticas de nivel Critical bajo su Preparedness Framework.

Astra se acerca al umbral Critical en ciberseguridad

Según el marco de preparación de OpenAI, un modelo alcanza el umbral Critical cuando puede identificar y desarrollar exploits zero-day funcionales, de distintos niveles de severidad, contra numerosos sistemas críticos endurecidos del mundo real sin intervención humana. También considera la capacidad de diseñar y ejecutar estrategias novedosas de ataque de extremo a extremo contra objetivos protegidos a partir de un objetivo general.

Las evaluaciones de Astra todavía son preliminares y OpenAI continúa sometiendo al modelo a pruebas y benchmarks. La compañía precisó además que Astra no estuvo involucrado en la explotación de Hugging Face.

Los modelos anteriores de OpenAI, incluido GPT-5.6-Sol, habían sido evaluados en capacidades cibernéticas de frontera dentro del nivel High, por debajo del umbral Critical.

OpenAI endurece los controles para desarrollar Astra

Ante estos resultados, OpenAI amplió las pruebas de robustez de sus salvaguardas y reforzó los controles aplicados al desarrollo del modelo. Las medidas incluyen entornos de prueba aislados, restricciones de acceso a redes y herramientas, mayores protecciones y cifrado de los pesos del modelo, capacidades adicionales de monitoreo y detección, además de ejecución en sandbox.

La compañía también pausó las actividades internas con Astra que todavía no cumplen estos requisitos reforzados. Además, implementó monitoreo universal de acciones riesgosas y posibles desalineaciones en todas las aplicaciones agénticas del modelo durante su entrenamiento y evaluación.

OpenAI trabajará con organismos gubernamentales pertinentes y organizaciones seleccionadas de seguridad de IA para evaluar las capacidades de Astra. También proporcionará controles de seguridad recomendados a socios externos que realicen evaluaciones y cargas de trabajo consideradas de mayor riesgo.