Tiempo de lectura: 6 minutos
Imagen: Ruben Marcu

Anthropic ha presentado esta tarde Claude Opus 5.5, el primer modelo de su nueva familia Claude 5.5. Las cifras compartidas prometen hasta un 40 % menos de coste, más de un 30 % de mejora en velocidad de generación y avances considerables en programación autónoma.

En un principio, el lanzamiento parece apostar más por la eficiencia y la capacidad de completar trabajos largos que por una ruptura absoluta respecto a los mejores modelos actuales.

Un 40 % más barato y más de un 30 % más rápido

Uno de los principales cambios está en el coste. Claude Opus 5.5 pasa a costar 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida, frente a los 5 y 25 dólares respectivamente de Opus 5.

Las lecturas de caché bajan todavía más: de 0,50 a 0,20 dólares por millón de tokens, mientras que las escrituras pasan de 6,25 a 5 dólares. Anthropic calcula que, combinando el menor precio con una reducción del número de tokens necesarios para completar determinadas tareas, Opus 5.5 puede resultar aproximadamente un 40 % más barato en cargas de trabajo habituales.

El modelo también genera respuestas más de un 30 % más rápido que Opus 5.

66,4 % en Terminal-Bench y 54,4 % en FrontierCode

Las mejoras también aparecen en los benchmarks. Claude Opus 5.5 consigue un 66,4 % en Terminal-Bench 4.0, frente al 52,3 % de Opus 5. En esta prueba, centrada en tareas complejas ejecutadas desde terminal, GPT-6 Astra obtiene un 57,9 %. En FrontierCode v1.1, Opus 5.5 alcanza un 54,4 %, ligeramente por encima del 53,3 % de GPT-6 Astra y del 50,3 % de Claude Fable 5.1. En CursorBench 4.0 obtiene un 57,8 %, frente al 46,6 % de Opus 5.

Las cifras muestran un salto generacional considerable, aunque Anthropic reconoce que, a estos niveles de rendimiento, unos pocos puntos de diferencia en un benchmark no siempre reflejan fielmente lo que ocurre después en tareas reales.

680.000 líneas de código en menos de un día

Es precisamente en esas tareas reales donde Anthropic quiere situar el foco. Uno de los probadores iniciales utilizó Opus 5.5 para completar una migración de aproximadamente 680.000 líneas de código en menos de un día, una tarea que, según el propio evaluador, habría requerido semanas de trabajo para un equipo de ingeniería.

En otra prueba, el modelo auditó y corrigió una base de código de 200.000 líneas en menos de tres horas. Opus 5 necesitó más de 20 horas para realizar el mismo trabajo y utilizó alrededor de 2,5 veces más tokens.

La apuesta está en los agentes

El lanzamiento refleja hacia dónde se está desplazando buena parte de la competencia entre los grandes modelos de inteligencia artificial.

Ya no se trata únicamente de generar correctamente un fragmento de código, sino de mantener un agente trabajando durante horas sobre un proyecto completo: abrir archivos, utilizar terminales, modificar diferentes partes del software, ejecutar pruebas y corregir sus propios errores. Opus 5.5 está especialmente orientado a este tipo de tareas prolongadas.

Anthropic probó, por ejemplo, la traducción de HAProxy desde C a Rust. Tanto Opus 5.5 como Claude Fable 5.1 consiguieron superar prácticamente todas las pruebas de regresión del proyecto, pero Opus 5.5 terminó el trabajo en 9,5 horas, frente a las 12 horas de Fable 5.1, y con un coste un 51 % inferior.

1.846 puntos Elo en trabajo profesional

Las mejoras no se limitan a la programación. En GDPval-AA v2.1, una prueba que evalúa tareas profesionales de 44 ocupaciones distintas, Claude Opus 5.5 alcanza 1.846 puntos Elo, frente a los 1.735 de Claude Fable 5.1 y los 1.708 de Opus 5.

Anthropic también ha evaluado el modelo en escenarios financieros y empresariales. En una de sus pruebas internas, Opus 5.5 y Opus 5 tuvieron que analizar la posible fusión entre dos empresas ficticias, elaborar un modelo financiero en Excel y convertir los resultados en una presentación ejecutiva. Ambos modelos llegaron a conclusiones similares, pero Opus 5.5 completó todo el proceso en 63 minutos, frente a los 93 minutos de Opus 5, y con un coste aproximado un 50 % inferior.

No gana absolutamente en todo

Las cifras también muestran que la competencia entre los modelos de frontera sigue siendo muy ajustada.

En Terminal-Bench-Science 0.1, por ejemplo, Claude Opus 5.5 obtiene un 58,7 %, mientras que GPT-6 Astra alcanza un 64,6 %. En AutomationBench, Opus 5.5 obtiene un 40 %, ligeramente por debajo del 41,4 % registrado por GPT-6 Astra.

Esto no resta importancia a la mejora frente a Opus 5, pero sí muestra un escenario en el que ya resulta difícil hablar de un único modelo claramente superior en todas las categorías; Anthropic reconoce que las diferencias entre benchmarks son cada vez menos útiles para medir el comportamiento real de modelos situados en niveles similares de capacidad.

Más protección frente al prompt injection

El aumento de la autonomía de estos modelos también introduce nuevos riesgos de seguridad. Uno de los principales riesgos son los ataques de prompt injection. Consisten en introducir instrucciones maliciosas dentro de una página web, un documento o un archivo para intentar que el modelo las interprete como órdenes legítimas. Por ejemplo, un agente podría estar analizando una web y encontrar un texto oculto que trate de convencerlo de ignorar las instrucciones del usuario, extraer información sensible o ejecutar una acción que no estaba prevista.

Anthropic asegura que Opus 5.5 mejora su resistencia frente a este tipo de ataques en tareas de programación, navegación web, uso de herramientas y control de ordenadores. Además, la compañía añade una segunda capa de protección: un clasificador que revisa determinadas acciones antes de que se ejecuten y un entorno aislado o sandbox que limita el alcance del agente y permite a los equipos de seguridad auditar su comportamiento.

Un 85 % menos de intentos de superar sus límites

Claude Opus 5.5 también mejora en las pruebas internas de seguridad de Anthropic. Una de ellas analiza si el modelo intenta saltarse las restricciones del entorno en el que está trabajando, por ejemplo tratando de acceder a recursos, herramientas o espacios para los que no tiene permiso.

Según Anthropic, en esta evaluación Opus 5.5 intentó superar esos límites aproximadamente un 85 % menos de veces que Opus 5 o Claude Mythos 5.1. Además, la compañía afirma que los pocos intentos detectados fueron de baja gravedad y que el propio modelo los comunicó.

Sin embargo, Anthropic reconoce una limitación importante de este tipo de pruebas: los modelos avanzados parecen detectar en ocasiones que están siendo evaluados. Si un sistema sospecha que se encuentra dentro de una prueba de seguridad, podría comportarse de forma distinta a como lo haría en una situación real. Por eso, estos resultados son una señal positiva, pero no permiten garantizar por sí solos cómo actuará el modelo en todos los entornos posibles.

Ciberseguridad y biología seguirán teniendo restricciones

El aumento de capacidades de Claude Opus 5.5 también obliga a Anthropic a limitar algunos de sus usos más sensibles. La compañía no aplica las mismas restricciones a todas las tareas: permite el uso normal del modelo en escenarios cotidianos, pero reserva controles adicionales para ámbitos en los que una respuesta más capaz podría facilitar usos peligrosos.

En ciberseguridad, Opus 5.5 podrá seguir ayudando a detectar errores, revisar código y corregir vulnerabilidades dentro del ciclo habitual de desarrollo de software. Sin embargo, determinadas tareas consideradas más sensibles serán redirigidas automáticamente a otros modelos con mayores restricciones. Anthropic prepara además una ampliación de su Cyber Verification Program, un sistema mediante el cual profesionales previamente verificados podrán acceder a capacidades adicionales para trabajos legítimos de seguridad.

La compañía aplica un enfoque similar en biología. Debido al nivel alcanzado por el modelo en tareas científicas, algunos usos avanzados estarán sujetos a controles específicos. Laboratorios, empresas e instituciones que necesiten emplear Claude en trabajos de investigación podrán solicitar acceso a través del programa de verificación de ciencias de la vida, pensado para distinguir entre investigación legítima y usos potencialmente riesgosos.

Protección frente a la destilación de modelos

Opus 5.5 incorpora además preserved thinking, una protección diseñada para dificultar los ataques de destilación. La destilación permite utilizar grandes cantidades de interacciones con un modelo avanzado para intentar reproducir parte de sus capacidades en otro sistema.

El mecanismo limita determinadas modificaciones del contexto interno de Claude que podrían utilizarse para extraer información sobre su proceso de razonamiento.

Respuestas más claras y menos verbosas

Anthropic también ha trabajado en un problema menos espectacular, pero importante en el uso diario: la forma en que responde el modelo. Según la compañía, Opus 5.5 coloca la información importante antes, reduce expresiones innecesariamente técnicas y sigue de forma más consistente las instrucciones de estilo.

El objetivo es hacer que el modelo resulte más sencillo de supervisar durante sesiones de trabajo prolongadas, especialmente cuando actúa como agente durante decenas de minutos o incluso varias horas.

Claude Opus 5.5: evolución más que revolución

Claude Opus 5.5 supone un salto claro frente a Opus 5, especialmente en coste, velocidad, programación autónoma y trabajos de larga duración.

La apuesta vuelve a ser similar a la que ya vimos en el salto de Opus 4.8 a Opus 5: conseguir que un modelo de frontera pueda realizar más trabajo real utilizando menos tokens, en menos tiempo y con un coste menor.

Claude Opus 5.5 ya está disponible en las plataformas de Anthropic y a través de Amazon Web Services, Google Cloud y Microsoft Azure, mientras que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán durante las próximas semanas.