Claude Opus 5.5: análisis de benchmarks y coste real para empresas
TL;DR
Anthropic lanzó Claude Opus 5.5 el 22 de septiembre, tres semanas después de Fable 5.1, y la noticia incómoda para su propio catálogo es esta: el modelo de gama media supera al buque insignia en casi todos los benchmarks publicados y cuesta 2,5 veces menos por token. En las tablas oficiales, Opus 5.5 gana a Fable 5.1 en Terminal-Bench 4.0 (66,4% frente a 55,8%), FrontierCode (54,4% frente a 50,3%), CursorBench (57,8% frente a 51,8%) y GDPval, la evaluación de trabajo profesional real (1.846 Elo frente a 1.735). El precio baja un 20% —4 $/M de entrada y 20 $/M de salida— y la lectura de caché cae un 60%, hasta 0,20 $/M. Anthropic promete un 40% menos de coste operativo; nuestro cálculo con tarifas oficiales da entre 22% y 27% garantizado por precio, y el resto depende de que el modelo consuma menos tokens en tu carga, cosa que no siempre ocurre: la evaluación independiente de Artificial Analysis lo midió generando 119.000 tokens por tarea a máximo esfuerzo, frente a 27.000 de GPT-6 Astra. En este artículo: qué mide cada benchmark y qué no, los dos sitios donde GPT-6 Astra sigue ganando, por qué Anthropic y Artificial Analysis publican cifras distintas del mismo test, el coste real calculado en dos escenarios de empresa, y qué hacer si ya tienes algo en producción sobre Claude.
Qué ha lanzado Anthropic exactamente
El 22 de septiembre de 2026 Anthropic publicó Claude Opus 5.5, disponible desde el primer día como claude-opus-5-5 en la API de Claude y en Amazon Web Services, Google Cloud y Microsoft Azure. Llega menos de dos meses después de Opus 5 y tres semanas después de Fable 5.1, un ritmo que conviene tener en cuenta antes de tomar cualquier decisión estructural: quien rediseñe su arquitectura alrededor de un modelo concreto va a repetir ese trabajo cada trimestre.
Las especificaciones técnicas relevantes:
- Ventana de contexto: 1 millón de tokens. Salida máxima: 128.000 tokens.
- Razonamiento adaptativo con cinco niveles de esfuerzo (bajo, medio, alto, extra-alto y máximo). El nivel medio es el predeterminado.
- El razonamiento no se puede desactivar en este modelo, a diferencia de generaciones anteriores.
- Modo rápido disponible (hasta 2,5 veces más velocidad de salida) a precio premium: 8 $/M de entrada y 40 $/M de salida.
- Generación de salida más de un 30% más rápida que Opus 5 en modo estándar.
- Marca de agua en el texto generado, incorporada para cumplir las obligaciones de transparencia del Reglamento europeo de IA. Es un detalle menor en el anuncio y bastante relevante para cualquier empresa española que publique contenido generado: conviene saber que existe.
- Preserved thinking: el razonamiento interno no es extraíble mediante edición de contexto, una medida antidestilación que afecta a cómo se construyen los sistemas que editan el historial de conversación.
Anthropic describe el modelo como “el de mejor rendimiento que hemos probado hasta la fecha” y afirma que supera a Fable —su gama superior— en muchas tareas, incluidas algunas donde Fable fallaba. Sonnet 5.5 y Haiku 5.5 llegarán “en las próximas semanas”, según la compañía.
Los benchmarks, uno a uno: qué mide cada uno y qué significa
Las tablas de un lanzamiento son material de marketing hasta que uno entiende qué mide cada prueba. Estos son los resultados publicados por Anthropic, con el contexto de qué evalúa cada benchmark y para quién es relevante.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| FrontierCode v1.1 | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| CursorBench 4.0 | 57,8% | 51,8% | 46,6% | — | 41,7% |
| GDPval-AA v2.1 (Elo) | 1.846 | 1.735 | 1.708 | 1.542 | 1.588 |
| AutomationBench | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| Humanity’s Last Exam (con herramientas) | 67,7% | 65,6% | 63,6% | 57,2% | — |
| OSWorld 2.0 (paso parcial) | 81,8% | 80,7% | 74,0% | — | — |
| Chartography (con herramientas) | 89,0% | 88,4% | 83,4% | — | — |
Terminal-Bench 4.0 mide si el modelo resuelve tareas reales en una terminal: instalar dependencias, depurar un fallo, manipular ficheros, encadenar comandos hasta completar un objetivo. Es el benchmark que mejor se correlaciona con “¿sirve este modelo para un agente que toca sistemas de verdad?”. El salto de 52,3% a 66,4% frente a Opus 5 es el mayor de toda la tabla, y explica por qué Anthropic vende este modelo como agéntico.
FrontierCode e CursorBench miden ingeniería de software: el primero con problemas de programación difíciles, el segundo con trabajo de código real en un editor. Aquí las diferencias entre los tres modelos de cabeza son de un punto o dos —54,4% frente al 53,3% de GPT-6 Astra—, es decir, dentro del margen en el que la elección del modelo importa menos que cómo esté montado el sistema alrededor.
GDPval es el más interesante para una empresa que no programa. Evalúa trabajo profesional real en 44 ocupaciones —informes, análisis, documentos, presentaciones— comparando entregables mediante puntuación Elo. Los 1.846 puntos de Opus 5.5 frente a los 1.542 de GPT-6 Astra son la brecha más grande de toda la tabla, unos 300 puntos, y apuntan a lo que sí notará quien use el modelo para trabajo de oficina cualificado: redacción, análisis documental, preparación de material.
AutomationBench mide flujos multipaso sobre herramientas SaaS: leer un correo, actualizar el CRM, generar un documento, notificar. Es exactamente lo que hacemos en un proyecto de automatización típico, y es uno de los dos sitios donde GPT-6 Astra gana (41,4% frente a 40,0%). La diferencia es de 1,4 puntos, irrelevante en la práctica, pero conviene decirlo: no hay un modelo que gane en todo.
Terminal-Bench-Science es el otro punto donde GPT-6 Astra gana, y con más holgura: 64,6% frente a 58,7%. Mide investigación científica ejecutada en terminal. Si tu caso es I+D con carga científica real, esa diferencia sí importa.
OSWorld mide control de sistema operativo (mover el ratón, usar aplicaciones de escritorio) y Chartography comprensión de gráficas. En ambos, el avance frente a Fable 5.1 es de menos de un punto y medio: mejoras de refinamiento, no de categoría.
El dato que Anthropic no destaca: dos cifras para el mismo test
Aquí está el matiz metodológico que merece la pena conocer antes de creerse ninguna tabla, incluida la nuestra.
Anthropic reporta 66,4% en Terminal-Bench 4.0 para Opus 5.5 frente al 57,9% de GPT-6 Astra. La evaluación independiente de Artificial Analysis mide el mismo benchmark y publica 59,6%, empatado con GPT-6 Astra.
No es que alguien mienta. Es que un benchmark agéntico no es un examen tipo test: el resultado depende del andamiaje que lo ejecuta —cuántos intentos permite, qué herramientas expone, cómo gestiona los errores, cuántos tokens de razonamiento concede—. Cada laboratorio evalúa con su propio arnés, afinado para sus modelos, y publica su cifra. Ambas pueden ser correctas y describir cosas distintas.
La conclusión práctica no es “los benchmarks no valen”. Es que valen para descartar, no para decidir: si un modelo va veinte puntos por debajo en la categoría que te importa, descártalo; si va uno o dos por encima, la tabla no te está diciendo nada útil sobre tu caso. La decisión se toma con tus tareas, y por eso publicamos nuestro propio benchmark de coste por tarea con la metodología abierta: no para que nos creas, sino para que puedas reproducirlo.
En el índice general de Artificial Analysis, por cierto, Opus 5.5 sí queda primero con 58 puntos a máximo esfuerzo, liderando seis de las diez evaluaciones del índice, incluidas Humanity’s Last Exam (61,4%) y SciCode (66,9%), y con 1.822 Elo en AA-Briefcase, la prueba de trabajo de conocimiento. Los cuatro niveles de esfuerzo del modelo se sitúan en la frontera de Pareto entre coste y rendimiento, que es una forma técnica de decir que, elijas el nivel que elijas, no hay una opción claramente mejor por el mismo dinero.
El otro dato incómodo: consume muchísimos tokens pensando
Anthropic afirma que Opus 5.5 “usa menos tokens por tarea” y que eso, sumado a la bajada de precio, produce un 40% menos de coste operativo. Artificial Analysis midió lo contrario en su índice: unos 119.000 tokens de salida por tarea a máximo esfuerzo, frente a 73.000 de Opus 5, 78.000 de Fable 5.1 y apenas 27.000 de GPT-6 Astra.
Las dos cosas pueden ser ciertas a la vez, y entender por qué es la diferencia entre presupuestar bien y llevarse un susto:
- A esfuerzo medio (el predeterminado), el modelo resuelve la tarea con menos idas y venidas: menos llamadas a herramientas, respuestas menos verbosas, menos reintentos. Ahí el ahorro en tokens es real.
- A esfuerzo máximo, que es como se corren los benchmarks, el modelo piensa mucho más: cuatro veces más tokens que GPT-6 Astra para la misma tarea. Un token de salida a 20 $/M multiplicado por 119.000 tokens son 2,38 $ por tarea solo de razonamiento.
Traducido a una regla operativa: el nivel de esfuerzo es la primera palanca de coste, por delante de la elección de modelo. Subirlo a máximo “por si acaso” en un flujo de alto volumen es la forma más rápida de multiplicar una factura. Nosotros trabajamos con esfuerzo bajo o medio por defecto y lo subimos solo en los pasos donde la evaluación demuestra que la calidad mejora — la misma lógica de arquitectura escalonada que documentamos en la guía de agentes de IA en empresa.
Cuánto cuesta de verdad: el cálculo con dos escenarios
Los precios de lista, verificados en la documentación oficial de Anthropic y recogidos en nuestro observatorio de precios:
| Concepto (por millón de tokens) | Opus 5.5 | Opus 5 | Fable 5.1 |
|---|---|---|---|
| Entrada | 4 $ | 5 $ | 10 $ |
| Salida | 20 $ | 25 $ | 50 $ |
| Lectura de caché | 0,20 $ | 0,50 $ | 0,25 $ |
| Escritura de caché (5 min) | 5 $ | 6,25 $ | 12,50 $ |
| Batch (entrada / salida) | 2 $ / 10 $ | 2,50 $ / 12,50 $ | 5 $ / 25 $ |
| Modo rápido (entrada / salida) | 8 $ / 40 $ | 10 $ / 50 $ | — |
La lectura de caché merece una nota: en Opus 5.5 se cobra al 5% del precio de entrada, cuando el estándar del resto de modelos es el 10%. Solo Fable 5.1 tiene un multiplicador mejor (2,5%), pero partiendo de un precio de entrada 2,5 veces mayor, así que en euros por millón la caché de Opus 5.5 sale más barata: 0,20 $ frente a 0,25 $.
Escenario A — asistente de atención al cliente. 10.000 conversaciones al mes, 3.000 tokens de contexto por conversación con un 60% servido desde caché, 500 tokens de respuesta.
| Modelo | Entrada no cacheada | Caché | Salida | Total/mes |
|---|---|---|---|---|
| Fable 5.1 | 120 $ | 4,50 $ | 250 $ | 374,50 $ |
| Opus 5 | 60 $ | 9 $ | 125 $ | 194 $ |
| Opus 5.5 | 48 $ | 3,60 $ | 100 $ | 151,60 $ |
| Sonnet 5 | 24 $ | 3,60 $ | 50 $ | 77,60 $ |
Escenario B — agente documental. 2.000 tareas al mes, 40.000 tokens de contexto con un 85% en caché, 2.000 tokens de salida.
| Modelo | Entrada no cacheada | Caché | Salida | Total/mes |
|---|---|---|---|---|
| Fable 5.1 | 120 $ | 17 $ | 200 $ | 337 $ |
| Opus 5 | 60 $ | 34 $ | 100 $ | 194 $ |
| Opus 5.5 | 48 $ | 13,60 $ | 80 $ | 141,60 $ |
Las conclusiones que salen de estos números, y que no coinciden del todo con la nota de prensa:
- El ahorro garantizado frente a Opus 5 es del 22% al 27%, no del 40%. Ese 22-27% viene solo de la bajada de tarifa y te lo llevas el día que cambias el identificador del modelo. El resto del 40% que anuncia Anthropic depende de que el modelo resuelva tus tareas con menos tokens, y eso hay que medirlo en tu carga, no darlo por hecho.
- Cuanta más caché usa tu arquitectura, más ahorras: el escenario documental (85% de caché) ahorra un 27% y el conversacional (60%) un 22%. Si tu sistema no usa caché de prompts, esta es la semana para arreglarlo; las técnicas concretas están en nuestra guía de reducción de costes de LLM.
- Frente a Fable 5.1, el ahorro es del 58-60% con mejor rendimiento en casi todos los benchmarks. Este es el titular real del lanzamiento.
Puedes hacer el cálculo con tus propios volúmenes en el estimador del observatorio de precios o, si estás dimensionando un bot desde cero, en la calculadora de coste de chatbot y voicebot.
Lo que este lanzamiento le hace al catálogo de Anthropic
Hace tres semanas escribimos que Claude Fable 5.1 era lo mejor disponible para las tareas de cúspide. Esa frase ya no se sostiene, y conviene decirlo con claridad en lugar de dejar el artículo antiguo envejeciendo en silencio: Opus 5.5 supera a Fable 5.1 en siete de las nueve pruebas publicadas y cuesta 2,5 veces menos por token.
Eso deja a la gama Fable en una posición extraña. Sigue teniendo sentido en casos concretos —contextos donde su multiplicador de caché del 2,5% domine, o cargas donde la evaluación propia demuestre que rinde mejor—, pero la regla general de “si necesitas lo máximo, paga Fable” ha dejado de ser cierta esta semana. Para la práctica totalidad de las empresas españolas, la recomendación por defecto pasa a ser Opus 5.5 en los pasos difíciles y Sonnet 5 o Haiku 4.5 en el volumen.
Es también un recordatorio de por qué insistimos tanto en que el modelo sea un parámetro de configuración y no un pilar de la arquitectura. En tres semanas, la respuesta correcta a “¿qué modelo uso?” ha cambiado dos veces. Quien tenga su sistema montado con el identificador del modelo en un fichero de configuración y una evaluación propia que pasar, absorbe estos cambios en una tarde. Quien lo tenga incrustado en la lógica, no.
Qué hacer esta semana, según dónde estés
Si ya operas sobre Claude en producción. Pasa Opus 5.5 por tu evaluación con tus tareas reales. Si iguala o supera en calidad, migra: el 22-27% de ahorro es inmediato y el cambio es un identificador. Mide el consumo de tokens antes y después —no des por hecho el 40%— y revisa a la vez el nivel de esfuerzo que tienes configurado, que es donde más dinero se escapa. Plazo razonable del ciclo completo: dos o tres días.
Si usas Fable 5.1. El caso es más claro todavía: mismo o mejor rendimiento por el 40% del precio. La única razón para quedarte es que tu evaluación diga lo contrario en tu caso concreto, cosa que puede pasar y por eso se evalúa.
Si estás a mitad de un proyecto. No lo pares. El modelo se decide al final, con la evaluación, no al principio con los titulares. Si alguien te propone re-presupuestar el proyecto “por el modelo nuevo”, tienes un problema de proveedor, no de tecnología.
Si no tienes nada en producción. Este lanzamiento no cambia tu prioridad, que sigue siendo elegir un proceso con dolor medible y llevarlo a producción. Lo que sí cambia es el argumento de esperar: la tecnología no se va a estabilizar, y cada trimestre que pasas esperando es un trimestre en el que las empresas que ya operan absorben automáticamente cada mejora de precio y rendimiento. Si no sabes por dónde empezar, el selector de modelo orienta la parte técnica y el diagnóstico gratuito la parte de negocio.
Y en todos los casos. Desconfía de la ola de esta semana. Cada lanzamiento de frontera produce titulares de “esto lo cambia todo” y de “es solo incremental”, y ambos venden clics. Lo que cambia de verdad se mide en tu evaluación y en tu factura, y las dos cosas se comprueban en días con método.
Preguntas frecuentes sobre Claude Opus 5.5
¿Cuánto cuesta Claude Opus 5.5?
4 $ por millón de tokens de entrada y 20 $ por millón de salida, un 20% menos que Opus 5. La lectura de caché baja un 60%, hasta 0,20 $ por millón, y el procesamiento por lotes cuesta la mitad (2 $ / 10 $). El modo rápido, que acelera la generación hasta 2,5 veces, sube a 8 $ / 40 $. En una carga empresarial típica con caché bien implementada, el ahorro real frente a Opus 5 se sitúa entre el 22% y el 27% solo por precio.
¿Es mejor que GPT-6 Astra?
Depende de la tarea, que es la respuesta aburrida y la única honesta. Opus 5.5 gana con claridad en trabajo profesional (1.846 frente a 1.542 Elo en GDPval) y en tareas de terminal según las cifras de Anthropic. GPT-6 Astra gana en automatización de flujos SaaS (41,4% frente a 40,0%) y en investigación científica en terminal (64,6% frente a 58,7%), y consume cuatro veces menos tokens por tarea, lo que en volumen alto puede compensar la diferencia de capacidad. Nuestra comparativa entre las dos familias mantiene el criterio metodológico y la actualizaremos con esta hornada.
¿Merece la pena migrar desde Opus 5 o desde Fable 5.1?
Desde Fable 5.1, casi siempre: rinde igual o mejor por el 40% del precio. Desde Opus 5, sí en cuanto tu evaluación confirme que no pierdes calidad, porque el ahorro es inmediato y el coste de migrar es cambiar una cadena de texto. En ambos casos la regla es la misma: se migra con datos propios, en ventana controlada y con vuelta atrás posible, nunca en caliente la semana del lanzamiento, que es cuando los proveedores ajustan infraestructura y aparecen los fallos de integración.
¿Está disponible en cloud europeo?
Sí. Opus 5.5 está disponible desde el primer día en la API de Anthropic y en AWS, Google Cloud y Microsoft Azure, lo que permite consumirlo desde regiones europeas con las garantías contractuales habituales. Ten en cuenta que los endpoints regionales de Bedrock y Vertex llevan un 10% de recargo sobre los globales, y que el modo rápido solo está disponible en la API directa de Anthropic. El marco de cumplimiento no cambia con el modelo: lo que importa sigue siendo qué región usas, qué datos envías y con qué minimización.
¿Qué implica la marca de agua para el AI Act?
Anthropic ha incorporado marca de agua en el texto generado por Opus 5.5 orientada a las obligaciones de transparencia del Reglamento europeo de IA. Para una empresa que genere contenido con el modelo, es un dato a conocer más que un problema: el Reglamento ya obliga a informar de que un contenido ha sido generado o manipulado con IA en determinados supuestos, y esta es una de las vías técnicas por las que los proveedores lo están implementando. Si tienes dudas sobre cómo te afecta el AI Act en tu caso, nuestro checklist de clasificación de riesgo responde en dos minutos, y la decisión final la valida tu asesoría legal.
¿Cuándo llegan Sonnet 5.5 y Haiku 5.5?
Anthropic ha anunciado que llegarán “en las próximas semanas”, sin fecha concreta. Es un dato relevante para planificar: si tu carga de volumen corre hoy sobre Sonnet 5 o Haiku 4.5, probablemente tengas otra bajada de precio-rendimiento en el tramo barato antes de fin de año. Un motivo más para no rediseñar nada alrededor de un modelo concreto y mantener la evaluación propia lista para pasarla cada vez.
¿Quieres aplicar esto en tu negocio?
30 minutos. Sin compromiso. Salimos con un mapa de oportunidades concreto.