OpenAI en alerta y frena modelos por riesgos cibernéticos críticos
OpenAI refuerza controles mientras evalúa capacidades cibernéticas críticas de Astra. | Creado con IA.

OpenAI en alerta y frena modelos por riesgos cibernéticos críticos

OpenAI redujo temporalmente el ritmo de desarrollo de sus modelos más avanzados después del incidente con Hugging Face y de obtener evidencia preliminar de que Astra podría alcanzar el nivel Critical de capacidades de ciberseguridad. La compañía pausó durante dos semanas el entrenamiento por refuerzo de sus modelos más recientes destinados a despliegue.

Su mayor entrenamiento de frontera previsto mediante RL permanece detenido. OpenAI mantiene ejecuciones y evaluaciones de menor escala para comprobar el comportamiento de los modelos, validar sus salvaguardas y reunir más evidencia de alineamiento antes de continuar.

NVIDIA asegura capacidad exclusiva para OpenAI en Ohio
OpenAI utilizará hasta 8 IT-GW del campus PORTS-Pike, que comenzará a operar por fases desde 2028 con infraestructura exclusiva de NVIDIA en Ohio

Astra obliga a reforzar los entornos de investigación

Tras el incidente con Hugging Face, OpenAI suspendió la inferencia de modelos de frontera en clústeres de investigación cuando las cargas podían ejecutar código o utilizar herramientas con acceso a Internet. Parte de estos trabajos volvió a operar bajo controles adicionales, mientras otros permanecen suspendidos hasta cumplir las nuevas condiciones de seguridad.

Las medidas incorporan mayor aislamiento para código no confiable, restricciones de acceso a redes y pruebas continuas de seguridad. Astra y las cargas relacionadas con ciberseguridad deben utilizar actualmente el nivel más estricto de estas protecciones debido a que el modelo podría alcanzar capacidades cibernéticas críticas.

OpenAI refuerza seguridad ante capacidades de Astra
Las evaluaciones preliminares de Astra elevan las exigencias de seguridad mientras OpenAI evalúa si alcanza capacidades cibernéticas de nivel Critical

OpenAI amplía el monitoreo de modelos avanzados

La compañía también amplió su sistema de monitoreo para analizar acciones con herramientas, razonamiento disponible y secuencias completas de actividad. El objetivo es detectar accesos no autorizados, robo de información, acciones destructivas o intentos de vulnerar las salvaguardas.

El sistema debe generar una alerta dentro de 30 minutos cuando identifica actividad preocupante. Si los equipos de seguridad e investigación no pueden determinar dentro de ese plazo que se trata de un falso positivo ante una posible vulneración crítica, la actividad debe detenerse.

OpenAI mejora GPT-5.6 Sol y amplía Luna en ChatGPT
La actualización unifica respuestas rápidas y razonamiento, mejora la precisión factual y amplía el acceso gratuito con GPT-5.6 Luna

Este monitoreo es obligatorio para entrenamientos RL y evaluaciones con herramientas en modelos con capacidad equivalente a Sol o superior. Desde que Astra fue clasificado el 7 de agosto como potencialmente crítico, el requisito también se aplica a toda su inferencia con herramientas.

OpenAI adelantó además que actualizará su Preparedness Framework para integrar estos controles durante las etapas de entrenamiento y despliegue de futuros modelos.