Anthropic presentó Claude Opus 5.5, el primer modelo de su nueva familia Claude 5.5, con cambios enfocados en rendimiento, costos, programación, trabajo profesional y seguridad. Según las pruebas de la compañía, ejecutarlo cuesta un 40% menos que Opus 5 en cargas de trabajo habituales y genera respuestas más de un 30% más rápido con la configuración predeterminada.

Claude Opus 5.5 reduce el costo por token y el uso de cómputo
El precio de Claude Opus 5.5 en la API es de US$4 por millón de tokens de entrada y US$20 por millón de tokens de salida, frente a los US$5 y US$25 de Opus 5. Las lecturas de caché bajan de US$0,50 a US$0,20 por millón de tokens, mientras que las escrituras cuestan US$5 por millón.
Anthropic también ofrece un modo rápido para Opus 5.5 en Claude Code y Claude Platform, que puede operar hasta 2,5 veces más rápido y tiene un precio de US$8 por millón de tokens de entrada y US$40 por millón de salida. La compañía además aumentará los límites de uso de cinco horas para los planes Pro, Max, Team y Enterprise basados en puestos.
En las evaluaciones publicadas por Anthropic, Opus 5.5 obtuvo 66,4% en Terminal-Bench 4.0 para programación agéntica y 54,4% en el conjunto principal de FrontierCode v1.1. También alcanzó 1.846 puntos Elo en GDPval-AA v2.1, evaluación orientada a tareas profesionales de 44 ocupaciones.
Mario Rodriguez, Chief Product Officer de GitHub, señaló que las pruebas realizadas con GitHub Copilot CLI y Visual Studio Code mostraron una reducción en la cantidad de pasos y tokens empleados por el nuevo modelo.
“Los desarrolladores quieren agentes que puedan asumir trabajo de software real y terminarlo. En nuestras pruebas con GitHub Copilot CLI y VS Code, Claude Opus 5.5 utilizó una de las menores cantidades de tokens y pasos que medimos. En VS Code, resolvió más tareas de terminal que Opus 5 en menos de la mitad de los pasos. Más que hacer más eficientes las tareas individuales, está haciendo que los proyectos más grandes de los desarrolladores sean más alcanzables”.

Programación y trabajo profesional con tareas de mayor duración
Anthropic orientó parte de las pruebas a trabajos que requieren mantener contexto y operar durante períodos prolongados, como migraciones de código, auditorías y tareas distribuidas entre varios repositorios. En una evaluación interna, Opus 5.5 y Fable 5.1 tradujeron HAProxy desde C a Rust y ambas versiones superaron casi todas las pruebas de regresión del proyecto, aunque Opus 5.5 terminó el trabajo en 9,5 horas frente a 12 horas y tuvo un costo 51% menor.
La compañía también evaluó el modelo en análisis financiero y generación de documentos empresariales mediante un ejercicio sobre una fusión ficticia, que exigía construir un modelo en Excel y una presentación ejecutiva. Opus 5.5 completó la tarea en 63 minutos frente a los 93 minutos de Opus 5 y, según Anthropic, redujo el costo del proceso en un 50%.
Strib Walker, director de Producto de Rogo, destacó la relación entre nivel de esfuerzo y consumo de tokens observada durante las evaluaciones internas de la empresa.
“Las firmas financieras necesitan resultados que sean consistentemente correctos. En su configuración de esfuerzo más baja, Claude Opus 5.5 superó a Opus 5 con esfuerzo alto en nuestro BigFinance Bench utilizando alrededor de un 60% menos de tokens de salida. Sus respuestas son más breves y están mejor estructuradas, y sus diapositivas resultan más densas y más acordes con los estándares de la industria”.

Anthropic incorpora nuevos controles para seguridad y uso autónomo
Claude Opus 5.5 incluye un clasificador que revisa las acciones antes de ejecutarlas, un entorno sandbox de código abierto que puede ser auditado por equipos de seguridad y herramientas de revisión de código orientadas a detectar vulnerabilidades. Anthropic afirma además que el modelo iguala o mejora los resultados de Opus 5 frente a ataques de inyección de instrucciones en sus pruebas de programación, uso de herramientas, control de computadores y navegación web.
En su auditoría automatizada de comportamiento, que incluye cerca de 2.000 escenarios, Anthropic reportó que Opus 5.5 obtuvo mejores resultados que los modelos Claude recientes en casi todas las métricas relacionadas con comportamientos desalineados. En una evaluación específica sobre límites de contención, el modelo intentó sortear esas restricciones aproximadamente un 85% menos que Opus 5 o Claude Mythos 5.1.

El modelo utiliza salvaguardas similares a las de Claude Fable 5.1 para áreas como ciberseguridad, biología y destilación de modelos, lo que puede derivar determinadas solicitudes hacia otros modelos. Anthropic señala que la mayoría de las tareas de ciberseguridad serán redirigidas a Opus 4.8, mientras que organizaciones verificadas podrán solicitar acceso ampliado para investigación biológica mediante su Life Sciences Verification Program.



