TL;DR
Entrevistamos 87 empresas latinoamericanas (México, Colombia, Argentina, Brasil, Chile) que tienen al menos un agente LLM en producción. Solo el 23% reporta ROI claro. El framework más usado es LangGraph (38%) seguido por CrewAI (21%) y propietario/custom (19%). En vector DB, Qdrant (34%) superó a pgvector (27%) y Weaviate (14%). En observabilidad, Langfuse es líder con 41% — triplicó cuota año contra año. Las tres principales barreras: integración con sistemas existentes (46%), costos de inferencia (38%), falta de evaluación sistemática (34%). Este informe publica los datos completos, las conclusiones por sector y el cruce entre stack elegido y probabilidad de reportar ROI.
Metodología
- Muestra: 87 empresas, de 15 a 3,200 empleados.
- Geografía: México (38), Colombia (19), Argentina (13), Brasil (11), Chile (6).
- Industrias: fintech (24), salud (13), retail/e-commerce (17), legal/servicios (10), SaaS B2B (14), gobierno/educación (9).
- Criterio de inclusión: al menos un agente LLM en producción por 3+ meses.
- Instrumento: cuestionario de 40 preguntas + entrevista de 45 min con el líder técnico.
- Periodo de campo: enero-marzo 2026.
- Datos anónimos agregados; el dataset curado se publica bajo CC-BY en
github.com/numoru-ia/latam-ai-agents-survey-2026.
Perfil de los agentes desplegados
Casos de uso principales
| Caso de uso | % empresas |
|---|---|
| Soporte al cliente (texto) | 58% |
| Generación de contenido interno | 47% |
| Asistente de ventas / SDR | 31% |
| Agente de búsqueda sobre documentos internos (RAG) | 44% |
| Automatización de operaciones backoffice | 28% |
| Agente de voz (call center, recepción) | 14% |
| Compliance / revisión legal | 9% |
| Agente de código | 22% |
| Multi-agente orquestado | 17% |
Nota: las empresas promedian 2.3 agentes cada una; por eso los porcentajes suman >100.
Madurez de deployment
- 43% son prototipos expuestos a <100 usuarios internos.
- 38% están en producción pero en un único canal o equipo.
- 19% están en producción multicanal con métricas de negocio conectadas.
Solo el último tercio reporta ROI medible.
Stack: qué usa realmente LATAM
Orquestación y frameworks
| Framework | % uso primario |
|---|---|
| LangGraph | 38% |
| CrewAI | 21% |
| Custom (Go/TS propios) | 19% |
| AutoGen | 8% |
| Mastra (TS) | 7% |
| Pydantic AI | 5% |
| Otros (Haystack, Semantic Kernel) | 2% |
LangGraph domina en sectores regulados (necesitan checkpointer, replay y controles finos). Custom sobresale en fintechs y equipos con ingeniería senior que ya tienen infraestructura Go robusta.
Vector databases
| Vector DB | % uso primario |
|---|---|
| Qdrant | 34% |
| pgvector (Postgres) | 27% |
| Weaviate | 14% |
| Pinecone | 11% |
| Chroma | 6% |
| Milvus | 5% |
| Otros | 3% |
Qdrant superó a pgvector por primera vez en nuestro panel. La razón citada: performance a volúmenes >1M vectores y soporte nativo de búsqueda híbrida. pgvector sigue siendo fuerte en equipos con equipo DBA maduro y volúmenes <500k.
Observabilidad
| Herramienta | % uso primario |
|---|---|
| Langfuse (self-hosted u OSS) | 41% |
| LangSmith | 18% |
| Phoenix (Arize) | 9% |
| OpenLLMetry + Grafana | 8% |
| Helicone | 5% |
| Nada formal | 14% |
| Otros | 5% |
Langfuse triplicó share año contra año. La razón: licencia Apache 2.0, opción self-hosted (crítica para compliance), y un ecosistema de integraciones que maduró en 2025.
El 14% que declara "nada formal" es casi idéntico al grupo que no reporta ROI. Correlación interesante.
Modelos más usados
| Modelo (por volumen de inferencia) | % |
|---|---|
| Claude Sonnet | 34% |
| GPT-4o / GPT-4o-mini | 28% |
| Claude Haiku | 12% |
| Llama 3.3 (local) | 9% |
| Gemini | 8% |
| Qwen 2.5 (local) | 4% |
| Otros | 5% |
Claude domina en sectores regulados por políticas de retención y soporte fuerte para tool use. GPT lidera en agentes de voz y chatbots de consumer. Modelos locales (Llama, Qwen) crecen fuerte en salud y legal.
Otras piezas del stack
- Redis como cache semántico o memoria: 52% lo usa.
- LiteLLM como gateway: 29% (creció rápido en 2025).
- MCP en producción: 18% (vs 2% hace un año).
- Mem0 / Zep para memoria semántica: 14%.
- Temporal / Inngest para flujos durables: 11%.
- Guardrails (NeMo, Guardrails AI): 23%.
ROI: qué separa al 23% del resto
Comparando el grupo "ROI claro" contra el resto, cinco factores aparecen con significación estadística:
1. Tienen evaluación sistemática (p < 0.01)
El 86% del grupo ROI tiene evals automatizados en CI/CD. Del resto, solo 19%. La moraleja: sin medir, no se mejora.
2. Observabilidad productiva (p < 0.01)
95% del grupo ROI usa Langfuse, LangSmith o Phoenix. Del resto, 52%. La visibilidad en producción es la diferencia entre corregir a tiempo y acumular deuda.
3. Stack tiered de memoria (p < 0.05)
58% del grupo ROI combina working memory + sessions + memoria semántica. Del resto, 21%. Agentes sin memoria estructurada pierden relevancia a partir del turno 10-15.
4. Guardrails en producción (p < 0.05)
48% del grupo ROI tiene guardrails activos (contenido, topic, PII). Del resto, 17%. Menos errores visibles al usuario = más confianza operativa.
5. Dueño único del agente (p < 0.05)
74% del grupo ROI tiene un dueño técnico-funcional nombrado (un PM de IA, líder de AI Ops o rol similar). Del resto, 36%. Sin dueño, el agente se degrada sin que nadie lo note.
Conclusión directa: no es el framework. Es la disciplina operativa. Un equipo con Langfuse + evals + memoria tiered + guardrails + dueño puede usar cualquier framework y le irá bien.
Barreras principales (self-reported)
| Barrera | % empresas que la mencionan |
|---|---|
| Integración con sistemas existentes | 46% |
| Costos de inferencia | 38% |
| Falta de evaluación sistemática | 34% |
| Data quality / preparación | 32% |
| Compliance / regulación | 27% |
| Talento escaso | 24% |
| Allucinaciones no controladas | 22% |
| Latencia | 19% |
| Adopción interna | 18% |
| Costo de infraestructura | 12% |
La integración con sistemas existentes es #1 por un margen claro. Por eso nuestro trabajo reciente apunta a MCP templates estandarizados: estandarizar esa capa es lo que más palanca tiene a nivel ecosistema.
Por sector
Fintech (n=24)
- Stack modal: LangGraph + Qdrant + Langfuse + Claude Sonnet.
- Uso principal: scoring asistido, atención al cliente, KYC.
- ROI reportado: 38%. Lidera el panel.
- Diferenciador: ya tenían MLOps; agregar LLMOps fue incremental.
Salud (n=13)
- Stack modal: LangGraph + Qdrant + Ollama (Llama 3.3 local) + Langfuse.
- Uso principal: resúmenes clínicos, triaje, documentación.
- ROI reportado: 15%. Más lento por compliance.
- Dolor: HIPAA + LFPDPPP + (si exportan) AI Act. Stack 100% on-prem para casos sensibles.
Retail / e-commerce (n=17)
- Stack modal: CrewAI + pgvector + LangSmith + GPT-4o-mini.
- Uso principal: atención al cliente, recomendaciones, descripciones de producto.
- ROI reportado: 24%.
- Dolor: alto volumen de inferencia = costos preocupantes. Cache semántico con Redis ya es tendencia fuerte.
Legal / servicios (n=10)
- Stack modal: Custom Go/TS + Qdrant + Langfuse + Claude Opus.
- Uso principal: drafting, revisión, búsqueda en documentación.
- ROI reportado: 30%.
- Dolor: confianza. Invierten mucho en evals y citaciones verificables.
SaaS B2B (n=14)
- Stack modal: LangGraph + Qdrant + Langfuse + Claude Sonnet.
- Uso principal: feature embebida en el producto (asistente in-app).
- ROI reportado: 21%.
- Dolor: diferenciar el asistente propio cuando Cursor/Claude ya son comodity.
Gobierno / educación (n=9)
- Stack modal: Mezclado, muchos con GPT-4o y poco stack propio.
- Uso principal: asistentes educativos, atención ciudadana.
- ROI reportado: 11%. El más bajo.
- Dolor: ciclos de compra largos, infraestructura rezagada.
Framework primario de orquestación reportado por empresa. Se permitieron múltiples respuestas en subproyectos; el primario se reporta aquí.
Encuesta Numoru LATAM AI Agents 2026. Dataset CC-BY.
Vector DB primaria por empresa. El liderazgo Qdrant vs pgvector depende del volumen de datos.
Encuesta Numoru LATAM AI Agents 2026.
Predicciones 2026-2027 (con base en el panel)
- Langfuse supera 60% de share en el panel antes de Q4 2026 — el self-host se vuelve default por compliance.
- MCP pasa de 18% a >40% en el panel — la estandarización acelera adopción.
- Modelos locales (Llama, Qwen) cruzan 25% por peso combinado de costos, privacidad y maduración de herramientas (Ollama + vLLM).
- Pipelines de evals en CI/CD se vuelven práctica estándar: correlacionan tan fuerte con ROI que los equipos serios ya los montan como parte del day-1.
- Dos patrones dominantes: a) agente único con MCP + tiered memory (PyMEs), b) multi-agente orquestado por LangGraph + Temporal (empresas medianas/grandes).
Recomendaciones accionables
Si estás empezando (0 agentes en producción)
- Elegir un caso de uso con métrica clara (ej. tiempo de respuesta, CSAT).
- Stack inicial: LangGraph + Qdrant + Langfuse + Claude Sonnet + Redis.
- Montar evals y observabilidad desde el día 1.
- Dueño único nombrado.
Si tienes 1-2 agentes en prototipo
- Resolver integración con sistema de registro (CRM, ERP) vía MCP.
- Introducir guardrails básicos.
- Migrar de notebook/script a orquestador formal.
Si tienes producción pero ROI incierto
- Auditoría de observabilidad — ¿hay trazas completas?
- Revisar prompt y memoria — tiered memory o retirada.
- Implementar evals de regresión en CI/CD.
Impacto de negocio
Qué vende el reporte
Estos datos son un producto en sí mismos. Numoru los comercializa de cuatro formas: el PDF premium de 80 páginas para inversores y equipos ops, un módulo de benchmarking donde el cliente se compara contra el panel, suscripción licenciada de investigación para consultoras que quieren el CSV raw, y el motor de lead gen que alimenta a los otros servicios Numoru (RAG rescue, GEO, AI Act, voz). Los analistas enterprise pagan múltiplos de este ticket por reportes McKinsey / Gartner menos específicos a LATAM.
Quién compra research como este
Pricing de investigación por comprador (Numoru, 2026)
Benchmarks públicos comparables
McKinsey — State of AI (anual)
LangChain — State of AI Agents
Caso ilustrativo — reseller de suscripción de research
Consultoría boutique (Bogotá) licenciando el research para su práctica de estrategia
Calculadora ROI — enterprise licenciando el panel
Oficina CIO benchmarkeando contra el panel de 87 empresas (12 meses)
| Fee reporte + engagement | −$9,500 |
| Tiempo interno | −$4,400 |
| Over-spend recapturado | +$57,600 |
| Mejores decisiones de stack (12% × $320k) | +$38,400 |
| Leverage negociación vendor | +$24,000 |
| Contribución neta año 1 | +$106,100 |
Tiers de pricing
- TL;DR + metodología
- Highlights de stats core
- Charts embedables con cita
- Link al dataset CC-BY
- Cross-tab: stack × ROI
- Breakdowns por sector
- 12 charts de appendix
- CSV raw CC-BY-NC
- Licencia de citación interna
- Comparación de stack y costo
- Workshop ejec. 60 min
- Miro board custom 15 páginas
- Playbook de negociación vendor
- Call de seguimiento 90 días
- Re-benchmarking 1 año
Licencias reseller y partnership se cotizan aparte. Contactar ventas.
FAQ
¿La muestra es representativa?Es la muestra más grande disponible en LatAm sobre este tema. No es probabilística (reclutamiento por LinkedIn + referidos de clientes), por lo que conclusiones deben leerse como direccionales, no como estadística poblacional.
¿Qué tan comparables son los ROIs entre empresas?Pedimos "ROI claro definido por la empresa" y no impusimos fórmula. Algunas miden tickets reducidos, otras conversión, otras NPS. El 23% es el grupo que pudo defender números ante su comité.
¿Por qué Qdrant supera a pgvector ahora? Volumen de datos: cuando las colecciones pasan 1M vectores o se requiere búsqueda híbrida, la arquitectura Rust de Qdrant escala mejor. pgvector sigue siendo ideal en <500k y equipos que ya operan Postgres.
¿Claude vs GPT-4?Cada uno domina nichos. Claude en sectores con alta necesidad de tool use confiable y políticas de retención estrictas. GPT en voz y consumer chat. Muchos equipos usan ambos vía LiteLLM con fallback.
¿El stack OSS realmente compite con SaaS?Sí cuando el equipo tiene 1 persona con experiencia DevOps y cuando los volúmenes justifican el costo fijo. Por debajo de 50k inferencias/mes, SaaS suele ganar por simplicidad.
Próximos pasos
El dataset completo y el script reproducible están en github.com/numoru-ia/latam-ai-agents-survey-2026. Si tu empresa quiere participar en la edición 2026-H2 (campo septiembre-octubre), el formulario está abierto. Publicaremos segmentos adicionales si el tamaño muestral alcanza: foodtech, edtech, proptech y logística.