Medición controlada del coste operativo por tarea completada en 3 escenarios reales de agente empresarial (revisión documental, tramitación de siniestros, atención cliente con backend). Con metodología pública y datos reproducibles.
Limitaciones de este benchmark: los 3 escenarios son representativos de casos B2B empresariales españoles pero no exhaustivos. Los precios de tokens fluctúan (los usados son los de junio 2026). Los evaluadores humanos son especialistas, no usuarios finales. Reproducir en tu caso concreto siempre es más informativo que confiar ciegamente en un benchmark externo.
| Modelo | €/tarea | Calidad /100 | Latencia | Escalado % |
|---|---|---|---|---|
| Claude Opus 5 | €0,18 | 91 | 18 s | 4 % |
| Claude Sonnet 4.6 | €0,07 | 84 | 11 s | 7 % |
| Claude Haiku 4.5 | €0,02 | 68 | 4 s | 18 % |
| GPT-5 | €0,16 | 87 | 21 s | 6 % |
| GPT-5 mini | €0,03 | 72 | 7 s | 14 % |
| Gemini 2.5 Ultra | €0,12 | 82 | 16 s | 9 % |
| Gemini 2.5 Flash | €0,02 | 67 | 5 s | 19 % |
| Llama 3.3 70B (on-prem) | €0,04 * | 73 | 28 s | 15 % |
* Coste amortizado en GPU A100 alquilada a $2,4/h · sin cargo por token. Requiere volumen constante para ser competitivo.
Ganador en calidad: Claude Opus 5 (91/100) · Mejor ratio calidad/coste: Claude Sonnet 4.6 (84/€0,07)
| Modelo | €/tarea | Calidad /100 | Latencia | Escalado % |
|---|---|---|---|---|
| Claude Opus 5 | €0,22 | 88 | 24 s | 7 % |
| Claude Sonnet 4.6 | €0,09 | 86 | 14 s | 9 % |
| Claude Haiku 4.5 | €0,03 | 75 | 6 s | 16 % |
| GPT-5 | €0,19 | 90 | 19 s | 5 % |
| GPT-5 mini | €0,04 | 82 | 8 s | 11 % |
| Gemini 2.5 Ultra | €0,15 | 85 | 17 s | 8 % |
| Gemini 2.5 Flash | €0,03 | 77 | 6 s | 14 % |
| Llama 3.3 70B (on-prem) | €0,05 * | 76 | 32 s | 13 % |
Ganador en calidad: GPT-5 (90/100) · Mejor ratio: GPT-5 mini (82/€0,04) · Nota: GPT-5 gana especialmente en extracción estructurada de PDFs y clasificación.
| Modelo | €/tarea | Calidad /100 | Latencia | Escalado % |
|---|---|---|---|---|
| Claude Opus 5 | €0,14 | 89 | 15 s | 8 % |
| Claude Sonnet 4.6 | €0,05 | 85 | 9 s | 10 % |
| Claude Haiku 4.5 | €0,01 | 78 | 3 s | 15 % |
| GPT-5 | €0,12 | 87 | 13 s | 9 % |
| GPT-5 mini | €0,02 | 80 | 5 s | 13 % |
| Gemini 2.5 Ultra | €0,10 | 84 | 12 s | 10 % |
| Gemini 2.5 Flash | €0,01 | 79 | 4 s | 14 % |
| Llama 3.3 70B (on-prem) | €0,03 * | 77 | 21 s | 15 % |
Ganador en calidad: Claude Opus 5 (89/100) · Mejor para volumen alto: Haiku 4.5 o Gemini Flash (78-79 de calidad a €0,01/tarea es sweet spot para chat de gran volumen)
Repetimos los 3 escenarios con la arquitectura recomendada: Claude Opus 5 solo para pasos difíciles + Claude Haiku 4.5 para 70 % de decisiones rutinarias + caché de prompts activo + RAG selectivo. Estos son los resultados finales.
| Escenario | Coste "Opus 5 en todo" | Coste arquitectura escalonada | Reducción | Calidad mantenida |
|---|---|---|---|---|
| E1 · Revisión legal | €0,18/tarea | €0,06/tarea | −67 % | 91 → 88 (−3 pt) |
| E2 · Siniestros | €0,22/tarea | €0,05/tarea | −77 % | 88 → 86 (−2 pt) |
| E3 · Atención cliente | €0,14/tarea | €0,013/tarea | −91 % | 89 → 84 (−5 pt) |
Conclusión práctica: "usar el mejor modelo para todo" es la forma más cara y menos eficiente de operar agentes en producción. La arquitectura escalonada + caché + RAG selectivo baja el coste operativo entre 67 % y 91 % con pérdida de calidad de solo 2-5 puntos (imperceptible en la mayoría de casos empresariales).
Modelamos coste real con tu volumen concreto en el diagnóstico gratuito. Y si ya tienes agente en producción, hacemos auditoría de coste con las mismas técnicas de este benchmark.