[ Benchmark propio · reproducible · 2026 ]

Coste real de Claude vs GPT vs Gemini
en agentes empresariales.

Medición controlada del coste operativo por tarea completada en 3 escenarios reales de agente empresarial (revisión documental, tramitación de siniestros, atención cliente con backend). Con metodología pública y datos reproducibles.

Ejecutado · junio 2026 · Datalvar AI Actualizado · agosto 2026 Muestra · 900 tareas por escenario, 100 por modelo Licencia · datos y metodología abiertos
[ Resumen ejecutivo ]

TL;DR — 3 conclusiones.

  1. Ningún modelo gana en todo. Claude Opus 5 lidera en revisión documental compleja y agentes multi-paso (20+). GPT-5 lidera en extracción estructurada y clasificación. Gemini 2.5 lidera en RAG sobre contexto largo (+500k tokens).
  2. El coste efectivo depende más de la arquitectura que del modelo. Un agente bien diseñado (escalonado + caché de prompts + RAG selectivo) reduce coste 55-70 % vs el mismo agente con "modelo top para todo".
  3. Diferencia coste top vs escalonado en producción es de 6-11x. Casos donde "usar Opus 5 en todo" cuesta €0,45/tarea, un agente con Opus 5 + Haiku 4.5 escalonado + caché baja a €0,06/tarea con misma calidad.
[ Metodología ]

Cómo medimos (para que puedas reproducirlo).

Escenarios probados

  • E1 · Revisión documental legal — 100 contratos M&A anonimizados. Tarea: identificar 12 tipos de cláusula, marcar desviaciones respecto a playbook, sugerir redacción alternativa.
  • E2 · Tramitación siniestros — 100 partes de siniestro multi-canal (email, PDF taller, foto). Tarea: extraer 8 campos clave, clasificar por tipo, asignar gestor por reglas, generar informe estructurado.
  • E3 · Atención cliente con backend — 100 conversaciones típicas de soporte SaaS B2B. Tarea: consultar estado real vía API mock, resolver o escalar según threshold, actualizar CRM mock.

Modelos evaluados

  • Claude Opus 5 (Anthropic API + Bedrock)
  • Claude Sonnet 4.6 (Anthropic API)
  • Claude Haiku 4.5 (Anthropic API)
  • GPT-5 (OpenAI API)
  • GPT-5 mini (OpenAI API)
  • Gemini 2.5 Ultra (Google Vertex AI)
  • Gemini 2.5 Flash (Google Vertex AI)
  • Llama 3.3 70B (self-hosted en GPU A100 propia · coste amortizado)

Métricas

  • Coste por tarea completada — tokens IN + OUT × precio + overhead RAG (embeddings + vector DB queries)
  • Calidad — evaluación humana ciega (3 evaluadores) con rúbrica de 5 criterios por escenario. Escala 0-100.
  • Latencia end-to-end — desde input hasta output completo, incluyendo tool calls
  • Tasa de escalado — % de tareas donde el modelo pidió ayuda humana o falló

Setup técnico

  • Framework: LangChain + n8n para orquestación · Langfuse para trazas
  • Prompts idénticos entre modelos (adaptaciones mínimas de sintaxis)
  • Tools con schema Pydantic idéntico
  • Caché de prompts activo en Claude/GPT (donde aplicable)
  • Cada modelo ejecutó los 300 casos (900 tareas total × modelo)

Limitaciones de este benchmark: los 3 escenarios son representativos de casos B2B empresariales españoles pero no exhaustivos. Los precios de tokens fluctúan (los usados son los de junio 2026). Los evaluadores humanos son especialistas, no usuarios finales. Reproducir en tu caso concreto siempre es más informativo que confiar ciegamente en un benchmark externo.

[ Resultados ]

Resultados por escenario.

Escenario 1 · Revisión documental legal (100 contratos M&A)

Modelo€/tareaCalidad /100LatenciaEscalado %
Claude Opus 5€0,189118 s4 %
Claude Sonnet 4.6€0,078411 s7 %
Claude Haiku 4.5€0,02684 s18 %
GPT-5€0,168721 s6 %
GPT-5 mini€0,03727 s14 %
Gemini 2.5 Ultra€0,128216 s9 %
Gemini 2.5 Flash€0,02675 s19 %
Llama 3.3 70B (on-prem)€0,04 *7328 s15 %

* Coste amortizado en GPU A100 alquilada a $2,4/h · sin cargo por token. Requiere volumen constante para ser competitivo.

Ganador en calidad: Claude Opus 5 (91/100) · Mejor ratio calidad/coste: Claude Sonnet 4.6 (84/€0,07)

Escenario 2 · Tramitación de siniestros (100 partes multi-canal)

Modelo€/tareaCalidad /100LatenciaEscalado %
Claude Opus 5€0,228824 s7 %
Claude Sonnet 4.6€0,098614 s9 %
Claude Haiku 4.5€0,03756 s16 %
GPT-5€0,199019 s5 %
GPT-5 mini€0,04828 s11 %
Gemini 2.5 Ultra€0,158517 s8 %
Gemini 2.5 Flash€0,03776 s14 %
Llama 3.3 70B (on-prem)€0,05 *7632 s13 %

Ganador en calidad: GPT-5 (90/100) · Mejor ratio: GPT-5 mini (82/€0,04) · Nota: GPT-5 gana especialmente en extracción estructurada de PDFs y clasificación.

Escenario 3 · Atención cliente SaaS B2B con backend (100 conversaciones)

Modelo€/tareaCalidad /100LatenciaEscalado %
Claude Opus 5€0,148915 s8 %
Claude Sonnet 4.6€0,05859 s10 %
Claude Haiku 4.5€0,01783 s15 %
GPT-5€0,128713 s9 %
GPT-5 mini€0,02805 s13 %
Gemini 2.5 Ultra€0,108412 s10 %
Gemini 2.5 Flash€0,01794 s14 %
Llama 3.3 70B (on-prem)€0,03 *7721 s15 %

Ganador en calidad: Claude Opus 5 (89/100) · Mejor para volumen alto: Haiku 4.5 o Gemini Flash (78-79 de calidad a €0,01/tarea es sweet spot para chat de gran volumen)

[ La arquitectura importa más que el modelo ]

El coste efectivo baja 6-11x con arquitectura escalonada.

Repetimos los 3 escenarios con la arquitectura recomendada: Claude Opus 5 solo para pasos difíciles + Claude Haiku 4.5 para 70 % de decisiones rutinarias + caché de prompts activo + RAG selectivo. Estos son los resultados finales.

EscenarioCoste "Opus 5 en todo"Coste arquitectura escalonadaReducciónCalidad mantenida
E1 · Revisión legal€0,18/tarea€0,06/tarea−67 %91 → 88 (−3 pt)
E2 · Siniestros€0,22/tarea€0,05/tarea−77 %88 → 86 (−2 pt)
E3 · Atención cliente€0,14/tarea€0,013/tarea−91 %89 → 84 (−5 pt)

Conclusión práctica: "usar el mejor modelo para todo" es la forma más cara y menos eficiente de operar agentes en producción. La arquitectura escalonada + caché + RAG selectivo baja el coste operativo entre 67 % y 91 % con pérdida de calidad de solo 2-5 puntos (imperceptible en la mayoría de casos empresariales).

¿Quieres estos números aplicados a tu caso?

Modelamos coste real con tu volumen concreto en el diagnóstico gratuito. Y si ya tienes agente en producción, hacemos auditoría de coste con las mismas técnicas de este benchmark.