OpenAI redujo temporalmente el ritmo de desarrollo de sus modelos más avanzados después del incidente con Hugging Face y de obtener evidencia preliminar de que Astra podría alcanzar el nivel Critical de capacidades de ciberseguridad. La compañía pausó durante dos semanas el entrenamiento por refuerzo de sus modelos más recientes destinados a despliegue.
Su mayor entrenamiento de frontera previsto mediante RL permanece detenido. OpenAI mantiene ejecuciones y evaluaciones de menor escala para comprobar el comportamiento de los modelos, validar sus salvaguardas y reunir más evidencia de alineamiento antes de continuar.

Astra obliga a reforzar los entornos de investigación
Tras el incidente con Hugging Face, OpenAI suspendió la inferencia de modelos de frontera en clústeres de investigación cuando las cargas podían ejecutar código o utilizar herramientas con acceso a Internet. Parte de estos trabajos volvió a operar bajo controles adicionales, mientras otros permanecen suspendidos hasta cumplir las nuevas condiciones de seguridad.
Las medidas incorporan mayor aislamiento para código no confiable, restricciones de acceso a redes y pruebas continuas de seguridad. Astra y las cargas relacionadas con ciberseguridad deben utilizar actualmente el nivel más estricto de estas protecciones debido a que el modelo podría alcanzar capacidades cibernéticas críticas.

OpenAI amplía el monitoreo de modelos avanzados
La compañía también amplió su sistema de monitoreo para analizar acciones con herramientas, razonamiento disponible y secuencias completas de actividad. El objetivo es detectar accesos no autorizados, robo de información, acciones destructivas o intentos de vulnerar las salvaguardas.
El sistema debe generar una alerta dentro de 30 minutos cuando identifica actividad preocupante. Si los equipos de seguridad e investigación no pueden determinar dentro de ese plazo que se trata de un falso positivo ante una posible vulneración crítica, la actividad debe detenerse.

Este monitoreo es obligatorio para entrenamientos RL y evaluaciones con herramientas en modelos con capacidad equivalente a Sol o superior. Desde que Astra fue clasificado el 7 de agosto como potencialmente crítico, el requisito también se aplica a toda su inferencia con herramientas.
OpenAI adelantó además que actualizará su Preparedness Framework para integrar estos controles durante las etapas de entrenamiento y despliegue de futuros modelos.


