Medición end-to-end de latencia para bots conversacionales en español, desde la palabra final del usuario hasta el primer audio/token de respuesta. Con desglose por componente (ASR, LLM, TTS, red) y umbrales aceptables por caso de uso.
| Configuración | ASR | LLM TTFT | TTS TTFA | E2E |
|---|---|---|---|---|
| Deepgram Nova-3 + Haiku 4.5 + Cartesia Sonic | 240 ms | 320 ms | 220 ms | 780 ms |
| Deepgram Nova-3 + Sonnet 4.6 + ElevenLabs Turbo v3 | 240 ms | 620 ms | 380 ms | 1240 ms |
| Whisper v4 + Opus 5 + Azure Neural | 580 ms | 1450 ms | 820 ms | 2850 ms |
| Azure Speech + GPT-5 mini + Azure Neural | 420 ms | 480 ms | 780 ms | 1680 ms |
| Deepgram + Gemini 2.5 Flash + Google WaveNet | 240 ms | 380 ms | 640 ms | 1260 ms |
| ElevenLabs STT + Llama 3.3 on-prem + ElevenLabs Turbo | 310 ms | 560 ms | 380 ms | 1250 ms |
Sub-segundo alcanzado con la combinación Deepgram + Haiku 4.5 + Cartesia. Para casos donde la calidad conversacional exige un modelo mayor, la mejor combinación es Sonnet 4.6 + ElevenLabs Turbo (1.2 s, todavía natural).
| Modelo | TTFT p50 | TTFT p95 | Total (respuesta completa) |
|---|---|---|---|
| Claude Haiku 4.5 | 380 ms | 720 ms | 1.4 s |
| Gemini 2.5 Flash | 420 ms | 810 ms | 1.6 s |
| GPT-5 mini | 580 ms | 1180 ms | 2.1 s |
| Claude Sonnet 4.6 | 720 ms | 1450 ms | 3.2 s |
| Gemini 2.5 Ultra | 1200 ms | 2400 ms | 5.8 s |
| Claude Opus 5 | 1450 ms | 2800 ms | 7.1 s |
| GPT-5 | 1620 ms | 3100 ms | 7.5 s |
| Llama 3.3 70B on-prem | 820 ms | 1650 ms | 4.2 s |
Para chat con streaming, cualquier TTFT <1 s se percibe como "instantáneo". Haiku 4.5, Gemini Flash y GPT-5 mini son las opciones donde el usuario nunca ve "escribiendo…". Opus 5 y GPT-5 se notan pausa pero son aceptables si la calidad de respuesta lo justifica.
| Ruta | TTFT medio | Overhead vs baseline | Recomendado para |
|---|---|---|---|
| Anthropic API directa (US-East) | 620 ms | baseline | Bajo requisito regulatorio |
| Anthropic Bedrock Frankfurt (EU) | 710 ms | +90 ms | Compliance UE, casos generales |
| Anthropic Bedrock Spain (nuevo 2026) | 640 ms | +20 ms | Compliance UE, alta latencia crítica |
| Azure OpenAI Spain Central | 580 ms | −40 ms | Compliance UE + baja latencia |
| GCP Vertex Madrid | 660 ms | +40 ms | Google-first + compliance |
| On-prem GPU A100 (Madrid DC) | 420 ms | −200 ms | Máximo control · datos regulados críticos |
| Caso de uso | Óptimo | Aceptable | Frustra al usuario |
|---|---|---|---|
| Voicebot atención humano | <800 ms | 800-1500 ms | >1500 ms |
| Voicebot IVR/menú | <600 ms | 600-1000 ms | >1000 ms |
| Chatbot con streaming | <500 ms TTFT | 500-1200 ms | >1200 ms sin "escribiendo…" |
| Chatbot sin streaming | <2 s total | 2-4 s total | >4 s total |
| Autocompletado / suggest | <200 ms | 200-400 ms | >400 ms |
| Agente multi-paso interno | <10 s total | 10-30 s | >30 s sin feedback |
Regla práctica: el usuario tolera latencia si sabe que algo está pasando. En chat con streaming, el primer token en <800 ms es imperceptible. En voz, cualquier pausa >1,5 s se siente como "el bot no me ha entendido" — mejor emitir un audio de "un momento…" que dejar silencio largo.
Puedes usar estas cifras citando la fuente. Referencia sugerida:
Datalvar AI (2026). Latencia de voicebots y chatbots IA en español (benchmark 2026). Actualizado el 22 de agosto de 2026. https://datalvarai.com/benchmarks/latencia-voicebot-chatbot-espanol-2026/
Diseñamos arquitecturas conversacionales con foco en latencia sub-segundo y calidad conversacional. Diagnóstico gratuito de 30 min con estimación de latencia esperada para tu caso concreto.
Es un asistente automático. Los datos que compartas para que te contactemos se tratan según la política de privacidad.