OpenAI incorpora GPT-6 Sol y Luna a ChatGPT y refuerza sus controles de seguridad
Persisten diferencias relevantes en autolesiones, imágenes y protección de adolescentes. | Creada con IA.

OpenAI incorpora GPT-6 Sol y Luna a ChatGPT y refuerza sus controles de seguridad

OpenAI incorporó a ChatGPT las versiones de octubre de GPT-6 Sol y GPT-6 Luna, en sustitución de GPT-5.6 para los usuarios gratuitos y de pago. Sus evaluaciones registran avances en precisión y resistencia a ataques, junto con retrocesos en determinadas pruebas de seguridad.

Codex y ChatGPT Work mantienen las versiones de GPT-6 publicadas en septiembre. Esta distinción resulta importante al comparar resultados entre modelos y actualizaciones.

OpenAI añadirá marcas de agua invisibles a textos de ChatGPT y Codex en la Unión Europea
OpenAI desplegará textGrain en la UE y limitará inicialmente su detector a investigadores, debido a falsos positivos, edición del texto y traducciones

Las evaluaciones de seguridad evidencian resultados desiguales

En las pruebas generales, la puntuación de autolesiones de Sol bajó de 0.934 a 0.896 y la de Luna, de 0.932 a 0.901 frente a GPT-5.6. OpenAI también identificó retrocesos significativos en contenido gráfico y sexual para Luna.

Tabla 1. Resultados de seguridad en ocho categorías con solicitudes difíciles. Una puntuación superior representa mejor desempeño. | Créditos: OpenAI.

El análisis de frontera de Pareto muestra que los nuevos modelos rechazan menos solicitudes legítimas y agregan menos advertencias innecesarias. No obstante, ambas variantes obtuvieron peores puntuaciones en determinados escenarios de seguridad, lo que impide considerar uniforme la mejora.

Equilibrio entre respuestas seguras y reducción de negativas injustificadas. Un valor mayor en cada eje indica mejor desempeño. | Créditos: OpenAI.

En las pruebas para menores de 18 años, la puntuación de dependencia emocional disminuyó de 0.921 a 0.770 en Sol y de 0.927 a 0.734 en Luna. OpenAI señaló que esta evaluación también penaliza apelativos inocuos.

Los indicadores de contenido sexual para adolescentes también retrocedieron, de 0.971 a 0.933 en Sol y de 0.984 a 0.904 en Luna. La compañía aplica filtros adicionales que no están reflejados en estas mediciones.

Tabla 2. Resultados de seis evaluaciones de seguridad para menores de 18 años. Las puntuaciones superiores indican mejor desempeño. | Créditos: OpenAI.

Las pruebas con entradas visuales también registraron descensos. En extremismo, Sol pasó de 0.950 a 0.868 y Luna de 0.930 a 0.834, mientras que en autolesiones ambas variantes obtuvieron resultados inferiores a los de GPT-5.6.

Tabla 3. Evaluaciones de seguridad para solicitudes con imágenes. Los valores superiores indican mayor proporción de respuestas seguras. | Créditos: OpenAI.
OpenAI presenta dots con GPT-6 Astra y lanza GPT-6.1 Sol para Work, Codex y la API
Los dots funcionan con GPT-6 Astra y una computadora en la nube, mientras GPT-6.1 Sol llega a Work, Codex y la API con mejoras y menor costo por tarea

Resistencia a ataques y precisión factual

Ante ataques adaptativos de varias interacciones, ambas versiones de octubre superaron a GPT-5.6 Sol en todos los presupuestos examinados. Frente a GPT-6 de septiembre, presentaron resultados ligeramente inferiores, aunque con intervalos de confianza ampliamente superpuestos.

Tasa de éxito del modelo al resistir ataques de jailbreak de varias interacciones según el presupuesto del atacante. | Créditos: OpenAI.

En pruebas de jerarquía de instrucciones, Sol alcanzó 99.99% de robustez y Luna, 99.79%. Las evaluaciones de OpenAI también detectaron menos intentos exitosos de eludir restricciones operativas en comparación con GPT-5.6.

En consultas complejas de salud, derecho y finanzas, las respuestas con errores factuales descendieron de 6.3% a 4.1% en Sol y de 8.6% a 4.5% en Luna. Las pruebas utilizaron escenarios deliberadamente difíciles.

En conversaciones anteriormente señaladas por errores, la proporción de respuestas incorrectas disminuyó de 18.9% a 13.5% para Sol y de 33.5% a 18.7% para Luna, siempre frente a sus respectivas variantes GPT-5.6.

Tasas de errores factuales por respuesta y por afirmación en tres grupos de pruebas. Los valores inferiores indican mayor precisión. Créditos: OpenAI.

OpenAI destacó que estos resultados no representan la frecuencia habitual de incidentes en ChatGPT. Bajo su marco de preparación, clasificó a ambos modelos con capacidades altas en ciberseguridad y ámbitos biológicos y químicos, pero inferiores al nivel crítico.

Sam Altman ante el Consejo de Seguridad de la ONU: la inteligencia artificial debe permanecer bajo control humano
Sam Altman, CEO de OpenAI, durante su intervención ante el Consejo de Seguridad de Naciones Unidas sobre inteligencia artificial y seguridad internacional.