Agente de IA
Sistema autónomo basado en un modelo de lenguaje que ejecuta procesos multi-paso sobre sistemas reales. A diferencia de un chatbot conversacional, un agente lee, decide, invoca herramientas (APIs), evalúa resultados y encadena acciones hasta completar un objetivo. En producción empresarial requiere una arquitectura de 6 capas: modelo, memoria, herramientas, orquestación, observabilidad y seguridad.
Qué es (y qué no es) un agente de IA
Un agente de IA es un sistema que utiliza un modelo de lenguaje (LLM) como cerebro para tomar decisiones y ejecutar acciones sobre sistemas reales — APIs, bases de datos, herramientas externas — con el objetivo de completar una tarea multi-paso. La diferencia clave respecto a un chatbot es la capacidad de actuar, no solo de responder.
Un chatbot conversacional te contesta a "¿cuál es el saldo de mi cuenta?" con texto. Un agente lee la pregunta, llama al API del CRM para consultar el saldo, verifica límites de exposición, revisa si hay operaciones pendientes, redacta un email personalizado al cliente si detecta anomalía, y actualiza el sistema con la interacción — todo sin intervención humana entre pasos.
La diferencia no es marketing. Es arquitectura: un chatbot vive en la capa de conversación; un agente vive en la capa de operaciones. Y cada uno resuelve problemas distintos.
Regla práctica: si el proceso implica más de 3 pasos secuenciales, requiere consultar sistemas distintos o toma decisiones basadas en datos que no están en el prompt, es un agente. Si es Q&A puro sobre información conocida, es un chatbot (o mejor, RAG).
Cuándo usar un agente y cuándo un workflow
No todo proceso quiere ser un agente. Los agentes son caros de operar y difíciles de depurar. Un workflow determinista con n8n o código puro es más barato, más rápido y más fiable cuando el proceso lo permite.
La arquitectura correcta suele ser híbrida: un workflow n8n orquesta el proceso a alto nivel (reglas de negocio, timeouts, retries, escalado), y llama a un agente solo en los pasos que requieren decisión con ambigüedad. Este enfoque reduce coste operativo entre un 40 % y un 70 % respecto a "agente para todo".
| Situación | Mejor opción | Por qué |
|---|---|---|
| Proceso 100 % reglas fijas conocidas | Workflow n8n o script | Sin ambigüedad no aporta valor la IA. El coste operativo no compensa. |
| Proceso con entrada en lenguaje natural | Agente | El LLM interpreta la intención y decide el flujo. Un workflow tendría 100 if/else. |
| Proceso con 20+ pasos y decisiones intermedias | Agente | El agente mantiene contexto entre pasos. Un workflow encadenado se rompe en depuración. |
| Necesita consultar múltiples sistemas dinámicamente | Agente con tools | El agente decide qué API llamar según el contexto. Workflow requiere flujo pre-diseñado. |
| Alto volumen y latencia crítica (<1s) | Workflow + regla | Agente añade 2-5s de latencia por paso. En tiempo real no cabe. |
| Datos regulados on-premise + alta complejidad | Agente open-source local | Llama o Mistral en tu infraestructura. Absorbe complejidad sin sacar datos. |
Arquitectura: las 6 capas del stack
Un agente en producción no es un endpoint LLM con un system prompt bonito. Es una arquitectura de 6 capas, cada una con problemas propios de operación.
- Capa 1 · Modelo — LLM base, escalonado por dificultad. No uses tu modelo más caro para todo: enruta Haiku/Flash para rutina, Opus/GPT solo para pasos complejos. Ahorro típico 40-60 % sin perder calidad.
- Capa 2 · Memoria — Contexto persistente + RAG selectivo. Un agente sin memoria repite trabajo. Meter todo el histórico al prompt es caro y ruidoso — recupera solo lo relevante esta iteración.
- Capa 3 · Herramientas (tools) — APIs y funciones que el agente puede llamar. Nombres explícitos, descripciones cortas, schemas de input estrictos. Un tool mal definido rompe todo lo que hay encima.
- Capa 4 · Orquestación — Workflow, retries, colas, humanos en el bucle. El agente decide qué hacer; el orquestador decide cuándo, cuántas veces y con qué timeout. Sin esta capa, un agente en producción es un experimento con presupuesto real.
- Capa 5 · Observabilidad — Trazas por paso, métricas, logs estructurados. Necesitas ver qué prompt exacto llamó a qué tool con qué resultado y cuánto costó. Sin esto, depurar es adivinar.
- Capa 6 · Seguridad — Guardrails, PII, roles, auditoría. Antes de conectar al mundo real, tienes que poder responder: "¿qué puede y qué no puede hacer, con qué datos?".
Si te falta cualquiera de las 6 capas, tienes un chatbot con esteroides — no un agente. Y en producción se romperá cuando aparezcan casos borde, cambios de API o intentos de prompt injection.
Casos de uso reales por área
Los agentes generan valor cuando el proceso combina volumen alto + decisión con ambigüedad + acceso a sistemas reales. Estas son las áreas donde más impacto vemos en empresa española.
- Legal / despachos — Revisión de contratos, due diligence en data rooms, extracción de cláusulas. Ver [[/agencia-de-ia-para-despachos-de-abogados/|landing legaltech]].
- Finanzas y contabilidad — Conciliación bancaria, procesamiento de facturas, reporting recurrente, análisis de gastos. Ver [[/negocios/agentes-ia-finanzas-contabilidad/|posts sector]].
- Back-office operaciones — Onboarding proveedores, gestión de incidencias, generación de contratos estándar, 5 casos que escalan bien.
- RRHH y talento — Filtrado CVs, entrevistas asíncronas, onboarding empleados. Ver [[/negocios/agentes-ia-rrhh-reclutamiento-onboarding/|casos RRHH]].
- Atención al cliente premium — Triaje de consultas, cualificación de leads, atención primer nivel con escalado a humano.
- Aseguradoras · tramitación — Partes de siniestro multi-canal, extracción con validación humana, escalado por confianza. Ver [[/agencia-de-ia-para-aseguradoras/|landing insurtech]].
- Sanidad · agenda y triaje — Voicebot 24/7 con derivación clínica, seguimiento post-tratamiento. Ver [[/agencia-de-ia-para-clinicas/|landing sanidad]].
Coste operativo de un agente en producción
En pilotos reales que hemos puesto en producción durante 2026, el coste operativo se sitúa entre €0,03 y €0,12 por conversación resuelta — con Claude Opus 5 escalonado con Haiku 4.5, caché de prompts activo y RAG selectivo. Rango muy dependiente del contexto: en agentes con 20+ pasos y RAG pesado el coste sube hasta €0,25-0,80 por conversación.
Breakdown típico del coste operativo:
- 55-70 % · LLM (modelo + tokens de entrada y salida)
- 15-25 % · Herramientas y memoria (APIs, embeddings, vector DB)
- 10-20 % · Observabilidad y guardrails (trazas, evals, moderación)
Tres cosas duplican el coste sin que nadie te avise: (1) meter todo el contexto al prompt "por si acaso", (2) usar el modelo más caro para todos los pasos, (3) no cachear el system prompt. Sin caché de prompts, un system prompt de 3.000 tokens se paga en cada llamada — con caché, una vez cada 5 min.
Errores típicos que rompen agentes en producción
- 1. No versionar prompts y tools — un cambio en producción sin registro rompe el agente y no sabes qué cambió. Trata prompts como código: commit, review, deploy.
- 2. Usar el modelo más caro para todo — Opus 5 para clasificar intent es tirar dinero. Enruta con lógica: Haiku/Flash para 70 % de decisiones, Opus solo para razonamiento complejo.
- 3. No cachear el system prompt — 3.000 tokens de contexto sin caché se pagan en cada llamada. Con Anthropic prompt caching bajas el coste 65-90 % en pasos rutinarios.
- 4. Meter todo el histórico al contexto — el agente rinde peor con más tokens, no mejor. RAG selectivo: recupera solo lo relevante para esta iteración.
- 5. Herramientas mal definidas — descripción ambigua o schema sin restricciones. El agente llama tools inventando parámetros. Schemas Pydantic/Zod estrictos son obligatorios.
- 6. Sin observabilidad por paso — sabes que el output es malo pero no dónde falló. Trazas por paso con LangSmith, Langfuse o Helicone son la única forma de depurar.
- 7. Sin humano en el bucle en pasos irreversibles — pagos, notificaciones al cliente, decisiones legales. Nunca. Siempre confirmación humana.
- 8. Sin límite de coste por conversación — un bug puede hacer que un agente entre en bucle y consuma cientos de euros en tokens en minutos. Circuit breaker obligatorio.
Cómo empezar: framework en 4 pasos
La forma correcta de arrancar con agentes no es un proyecto grande de 6 meses. Es un piloto acotado de 6-8 semanas sobre un proceso con ROI claro. Este framework es el que usamos en cada nuevo cliente:
- Paso 1 · Elige el proceso — aplica el framework de las 5 preguntas (volumen, estabilidad, medible, reversibilidad, sponsor). Si falla en 2 o más, no es tu primer piloto.
- Paso 2 · Prueba con el modelo básico — antes de arquitectura completa, valida que un LLM base + 2-3 tools puede hacer la tarea. Semana 1-2 en Jupyter con un dataset pequeño.
- Paso 3 · Diseña las 6 capas mínimas — modelo escalonado, RAG selectivo, tools con schema, orquestador con retries, observabilidad por paso, guardrails básicos. Semanas 3-5.
- Paso 4 · Producción con supervisión — despliegue en modo asistido (humano revisa 100 % del output) → gradual (50 % → 20 % → 5 % → auto) con métricas de calidad. Semanas 6-8.
Puedes evaluar tu proceso con la utilidad "¿Qué automatizar primero?" (framework 5 preguntas con score 0-100) y estimar coste con la calculadora ROI antes de pedirnos diagnóstico.
Preguntas frecuentes
¿Cuál es la diferencia real entre un chatbot y un agente de IA?
Un chatbot vive en la capa de conversación: recibe texto, devuelve texto. Un agente vive en la capa de operaciones: recibe un objetivo, decide qué pasos ejecutar, llama a sistemas reales (APIs, bases de datos), evalúa resultados y encadena acciones hasta completar la tarea.
La diferencia clave es la capacidad de actuar. Un chatbot te dice "tu factura del mes 12/2025 es de 234 €". Un agente lee la factura, la compara con el histórico, detecta un cargo anómalo, cancela el cargo si aplica, notifica al cliente y actualiza el CRM — todo sin humano intermedio.
Los chatbots resuelven consultas informativas. Los agentes ejecutan procesos operativos. Requieren arquitecturas distintas y tienen coste operativo distinto (agentes 3-10x más caro por interacción, pero absorben trabajo humano de otra magnitud).
¿Qué modelo de LLM es el mejor para agentes en producción?
Depende del paso concreto y del presupuesto. Para agentes multi-paso complejos (20+ decisiones), Claude Opus 5 es hoy el modelo que mejor mantiene contexto sin colapsar. GPT-5 rinde similar en muchas tareas y a veces mejor en generación de código. Gemini 2.5 Ultra tiene ventaja en RAG sobre documentos muy largos (contextos de +1M tokens).
Para pasos rutinarios (clasificación, extracción, decisiones simples) Claude Haiku 4.5 o Gemini 2.5 Flash son mucho más baratos y suficientemente buenos. Un agente bien diseñado enruta el 70 % de decisiones a modelos pequeños y solo dispara los modelos frontier cuando hace falta.
Puedes usar nuestra utilidad de selección de modelo LLM para una recomendación basada en tu caso concreto.
¿Se puede desplegar un agente completamente on-premise para datos regulados?
Sí. Para clientes en banca, sanidad, seguros o sector público que no pueden sacar datos de su infraestructura, desplegamos agentes basados en modelos open-source (Llama 3.3, Mistral Large, DeepSeek) en on-premise o en cloud privado europeo (Azure Spain, GCP Madrid, OVH).
La contrapartida: los modelos open-source rinden hoy un 5-15 % por debajo de los frontier comerciales en tareas complejas de agente. Para pasos que requieren máxima calidad, se puede hacer arquitectura híbrida: la mayoría de decisiones on-premise, y solo los pasos críticos delegan a un modelo comercial bajo contrato enterprise con no-retención (Anthropic Bedrock, Azure OpenAI, Vertex).
El coste operativo de agentes on-premise es distinto: no pagas por token pero pagas infraestructura (GPUs), mantenimiento y actualización. En volumen alto, on-premise sale más barato; en volumen bajo, la API sale mejor.
¿Cuánto cuesta un agente en producción al mes?
El coste operativo mensual de un agente empresarial suele situarse entre 200 € y 5.000 €/mes dependiendo del volumen, la complejidad y el modelo elegido. Un agente conversacional para atención primer nivel con 5.000 conversaciones/mes cuesta típicamente 300-800 €/mes. Un agente que procesa 2.000 documentos/mes con RAG sobre base grande puede estar en 1.500-3.500 €/mes.
A eso hay que sumar infraestructura (vector DB, observabilidad, orquestador) que suele añadir 150-400 €/mes según herramientas elegidas.
El coste de implementación del piloto es un one-off separado: 15-40 k€ típicamente para un piloto acotado. La calculadora ROI te da una estimación específica según tu caso.
¿Qué gobernanza IA hace falta para poner un agente en producción bajo AI Act?
Depende de la categoría de riesgo del sistema bajo el AI Act. Los agentes usados en procesos que afecten a personas (crédito, RRHH, sanidad, biometría, infraestructura crítica) son "alto riesgo" y requieren expediente técnico, evaluación de conformidad, sistema de gestión de riesgos, transparencia y supervisión humana.
Para agentes de bajo o mínimo riesgo (back-office, análisis interno, atención básica) las obligaciones son de transparencia y buenas prácticas, mucho más ligeras.
En cualquier caso, un agente en producción exige: registro del sistema en el inventario IA de la empresa, documentación de casos de uso, políticas de datos (RGPD + sectoriales), monitorización continua y plan de escalado humano si el sistema falla.
Ver también nuestra guía AI Act UE 2026: qué debe hacer una empresa española y el compliance kit descargable.