Medición end-to-end de latencia para bots conversacionales en español, desde la palabra final del usuario hasta el primer audio/token de respuesta. Con desglose por componente (ASR, LLM, TTS, red) y umbrales aceptables por caso de uso.
| Configuración | ASR | LLM TTFT | TTS TTFA | E2E |
|---|---|---|---|---|
| Deepgram Nova-3 + Haiku 4.5 + Cartesia Sonic | 240 ms | 320 ms | 220 ms | 780 ms |
| Deepgram Nova-3 + Sonnet 4.6 + ElevenLabs Turbo v3 | 240 ms | 620 ms | 380 ms | 1240 ms |
| Whisper v4 + Opus 5 + Azure Neural | 580 ms | 1450 ms | 820 ms | 2850 ms |
| Azure Speech + GPT-5 mini + Azure Neural | 420 ms | 480 ms | 780 ms | 1680 ms |
| Deepgram + Gemini 2.5 Flash + Google WaveNet | 240 ms | 380 ms | 640 ms | 1260 ms |
| ElevenLabs STT + Llama 3.3 on-prem + ElevenLabs Turbo | 310 ms | 560 ms | 380 ms | 1250 ms |
Sub-segundo alcanzado con la combinación Deepgram + Haiku 4.5 + Cartesia. Para casos donde la calidad conversacional exige un modelo mayor, la mejor combinación es Sonnet 4.6 + ElevenLabs Turbo (1.2 s, todavía natural).
| Modelo | TTFT p50 | TTFT p95 | Total (respuesta completa) |
|---|---|---|---|
| Claude Haiku 4.5 | 380 ms | 720 ms | 1.4 s |
| Gemini 2.5 Flash | 420 ms | 810 ms | 1.6 s |
| GPT-5 mini | 580 ms | 1180 ms | 2.1 s |
| Claude Sonnet 4.6 | 720 ms | 1450 ms | 3.2 s |
| Gemini 2.5 Ultra | 1200 ms | 2400 ms | 5.8 s |
| Claude Opus 5 | 1450 ms | 2800 ms | 7.1 s |
| GPT-5 | 1620 ms | 3100 ms | 7.5 s |
| Llama 3.3 70B on-prem | 820 ms | 1650 ms | 4.2 s |
Para chat con streaming, cualquier TTFT <1 s se percibe como "instantáneo". Haiku 4.5, Gemini Flash y GPT-5 mini son las opciones donde el usuario nunca ve "escribiendo…". Opus 5 y GPT-5 se notan pausa pero son aceptables si la calidad de respuesta lo justifica.
| Ruta | TTFT medio | Overhead vs baseline | Recomendado para |
|---|---|---|---|
| Anthropic API directa (US-East) | 620 ms | baseline | Bajo requisito regulatorio |
| Anthropic Bedrock Frankfurt (EU) | 710 ms | +90 ms | Compliance UE, casos generales |
| Anthropic Bedrock Spain (nuevo 2026) | 640 ms | +20 ms | Compliance UE, alta latencia crítica |
| Azure OpenAI Spain Central | 580 ms | −40 ms | Compliance UE + baja latencia |
| GCP Vertex Madrid | 660 ms | +40 ms | Google-first + compliance |
| On-prem GPU A100 (Madrid DC) | 420 ms | −200 ms | Máximo control · datos regulados críticos |
| Caso de uso | Óptimo | Aceptable | Frustra al usuario |
|---|---|---|---|
| Voicebot atención humano | <800 ms | 800-1500 ms | >1500 ms |
| Voicebot IVR/menú | <600 ms | 600-1000 ms | >1000 ms |
| Chatbot con streaming | <500 ms TTFT | 500-1200 ms | >1200 ms sin "escribiendo…" |
| Chatbot sin streaming | <2 s total | 2-4 s total | >4 s total |
| Autocompletado / suggest | <200 ms | 200-400 ms | >400 ms |
| Agente multi-paso interno | <10 s total | 10-30 s | >30 s sin feedback |
Regla práctica: el usuario tolera latencia si sabe que algo está pasando. En chat con streaming, el primer token en <800 ms es imperceptible. En voz, cualquier pausa >1,5 s se siente como "el bot no me ha entendido" — mejor emitir un audio de "un momento…" que dejar silencio largo.
Diseñamos arquitecturas conversacionales con foco en latencia sub-segundo y calidad conversacional. Diagnóstico gratuito de 30 min con estimación de latencia esperada para tu caso concreto.