[ Benchmark propio · reproducible · 2026 ]

Latencia de voicebots y chatbots IA
en español · 2026.

Medición end-to-end de latencia para bots conversacionales en español, desde la palabra final del usuario hasta el primer audio/token de respuesta. Con desglose por componente (ASR, LLM, TTS, red) y umbrales aceptables por caso de uso.

Ejecutado · julio 2026 · Datalvar AI Actualizado · agosto 2026 Muestra · 600 interacciones, 3 escenarios Setup · desde Madrid, ping medio 12 ms a US-East
[ Resumen ejecutivo ]

TL;DR — 4 conclusiones.

  1. Voicebot <1 s es alcanzable en 2026 pero exige arquitectura streaming end-to-end (ASR streaming + LLM streaming + TTS con primer chunk rápido). Latencia media viable: 780-1200 ms para respuestas naturales.
  2. Chatbot texto puede estar en 400-800 ms al primer token con Haiku 4.5 o Gemini Flash. Opus 5 y GPT-5 rondan 1500-2500 ms al primer token — visible como "el bot piensa" para el usuario.
  3. El cuello de botella suele ser el TTS, no el LLM. ElevenLabs Turbo y Cartesia Sonic dan primer chunk audio en 200-400 ms; muchas alternativas (Azure Neural, Polly) están en 800-1500 ms.
  4. Cloud europeo penaliza latencia hoy. Modelos vía Azure Spain, Bedrock Frankfurt o Vertex Madrid añaden 40-90 ms vs endpoints US-East. En voicebot esto se nota; en chat texto es imperceptible.
[ Metodología ]

Cómo medimos la latencia.

Escenarios probados

  • E1 · Voicebot atención cliente — 200 consultas típicas ("¿cuál es el estado de mi pedido?", "quiero cambiar de tarifa"). Español peninsular. Test desde Madrid.
  • E2 · Chatbot texto SaaS B2B — 200 mensajes de soporte técnico con acceso a backend simulado.
  • E3 · Voicebot cualificación de leads — 200 llamadas simuladas donde el bot cualifica presupuesto, plazo y necesidad antes de agendar humano.

Componentes medidos

  • ASR (Speech-to-Text) — desde silencio del usuario hasta transcript completo
  • LLM TTFT — Time To First Token desde envío hasta primer token de respuesta
  • LLM total — hasta último token
  • TTS TTFA — Time To First Audio desde texto hasta primer chunk audio
  • E2E — end-to-end desde silencio usuario hasta primer chunk audio de respuesta

Stack ASR / TTS probados

  • ASR: Deepgram Nova-3, ElevenLabs STT, OpenAI Whisper v4, Azure Speech Neural, Google Speech Chirp
  • TTS: ElevenLabs Turbo v3, Cartesia Sonic, Azure Neural, Google WaveNet, OpenAI TTS
  • Todos configurados en español peninsular, streaming activado

LLMs probados

  • Claude Opus 5 · Sonnet 4.6 · Haiku 4.5
  • GPT-5 · GPT-5 mini
  • Gemini 2.5 Ultra · Flash
  • Llama 3.3 70B (self-hosted GPU A100)
[ Resultados clave ]

Latencia end-to-end por componente.

Voicebot atención cliente (mediana de 200 interacciones)

ConfiguraciónASRLLM TTFTTTS TTFAE2E
Deepgram Nova-3 + Haiku 4.5 + Cartesia Sonic240 ms320 ms220 ms780 ms
Deepgram Nova-3 + Sonnet 4.6 + ElevenLabs Turbo v3240 ms620 ms380 ms1240 ms
Whisper v4 + Opus 5 + Azure Neural580 ms1450 ms820 ms2850 ms
Azure Speech + GPT-5 mini + Azure Neural420 ms480 ms780 ms1680 ms
Deepgram + Gemini 2.5 Flash + Google WaveNet240 ms380 ms640 ms1260 ms
ElevenLabs STT + Llama 3.3 on-prem + ElevenLabs Turbo310 ms560 ms380 ms1250 ms

Sub-segundo alcanzado con la combinación Deepgram + Haiku 4.5 + Cartesia. Para casos donde la calidad conversacional exige un modelo mayor, la mejor combinación es Sonnet 4.6 + ElevenLabs Turbo (1.2 s, todavía natural).

Chatbot texto (mediana de 200 mensajes)

ModeloTTFT p50TTFT p95Total (respuesta completa)
Claude Haiku 4.5380 ms720 ms1.4 s
Gemini 2.5 Flash420 ms810 ms1.6 s
GPT-5 mini580 ms1180 ms2.1 s
Claude Sonnet 4.6720 ms1450 ms3.2 s
Gemini 2.5 Ultra1200 ms2400 ms5.8 s
Claude Opus 51450 ms2800 ms7.1 s
GPT-51620 ms3100 ms7.5 s
Llama 3.3 70B on-prem820 ms1650 ms4.2 s

Para chat con streaming, cualquier TTFT <1 s se percibe como "instantáneo". Haiku 4.5, Gemini Flash y GPT-5 mini son las opciones donde el usuario nunca ve "escribiendo…". Opus 5 y GPT-5 se notan pausa pero son aceptables si la calidad de respuesta lo justifica.

Impacto de cloud europeo (residencia España/UE)

RutaTTFT medioOverhead vs baselineRecomendado para
Anthropic API directa (US-East)620 msbaselineBajo requisito regulatorio
Anthropic Bedrock Frankfurt (EU)710 ms+90 msCompliance UE, casos generales
Anthropic Bedrock Spain (nuevo 2026)640 ms+20 msCompliance UE, alta latencia crítica
Azure OpenAI Spain Central580 ms−40 msCompliance UE + baja latencia
GCP Vertex Madrid660 ms+40 msGoogle-first + compliance
On-prem GPU A100 (Madrid DC)420 ms−200 msMáximo control · datos regulados críticos
[ Umbrales aceptables ]

Cuánta latencia es demasiada.

Caso de usoÓptimoAceptableFrustra al usuario
Voicebot atención humano<800 ms800-1500 ms>1500 ms
Voicebot IVR/menú<600 ms600-1000 ms>1000 ms
Chatbot con streaming<500 ms TTFT500-1200 ms>1200 ms sin "escribiendo…"
Chatbot sin streaming<2 s total2-4 s total>4 s total
Autocompletado / suggest<200 ms200-400 ms>400 ms
Agente multi-paso interno<10 s total10-30 s>30 s sin feedback

Regla práctica: el usuario tolera latencia si sabe que algo está pasando. En chat con streaming, el primer token en <800 ms es imperceptible. En voz, cualquier pausa >1,5 s se siente como "el bot no me ha entendido" — mejor emitir un audio de "un momento…" que dejar silencio largo.

¿Voicebot o chatbot rápido de verdad?

Diseñamos arquitecturas conversacionales con foco en latencia sub-segundo y calidad conversacional. Diagnóstico gratuito de 30 min con estimación de latencia esperada para tu caso concreto.