Todas las contribuciones
Análisis de Industriaagentssurveylatam

Encuesta Numoru: estado de los agentes de IA en empresas LATAM 2026

Resultados de encuesta propia a 87 empresas latinoamericanas: frameworks usados (LangGraph, CrewAI, Mastra), vector DBs (Qdrant, pgvector, Weaviate), observabilidad (Langfuse, Phoenix) y barreras reales. Solo 23% reporta ROI claro.

Numoru StrategyPublicado el 14 de junio de 202616 min de lectura
Compartir
Propuesta de implementacióngithub.com/numoru-ia/latam-ai-agents-survey-2026

TL;DR

Entrevistamos 87 empresas latinoamericanas (México, Colombia, Argentina, Brasil, Chile) que tienen al menos un agente LLM en producción. Solo el 23% reporta ROI claro. El framework más usado es LangGraph (38%) seguido por CrewAI (21%) y propietario/custom (19%). En vector DB, Qdrant (34%) superó a pgvector (27%) y Weaviate (14%). En observabilidad, Langfuse es líder con 41% — triplicó cuota año contra año. Las tres principales barreras: integración con sistemas existentes (46%), costos de inferencia (38%), falta de evaluación sistemática (34%). Este informe publica los datos completos, las conclusiones por sector y el cruce entre stack elegido y probabilidad de reportar ROI.

87
Empresas encuestadas
MX, CO, AR, BR, CL · ene-mar 2026
23%
Reportan ROI claro
Correlaciona con disciplina de stack
38% / 34%
Share LangGraph / Qdrant
Líderes del panel
41%
Share de observabilidad Langfuse
Crecimiento 3× YoY

Metodología

  • Muestra: 87 empresas, de 15 a 3,200 empleados.
  • Geografía: México (38), Colombia (19), Argentina (13), Brasil (11), Chile (6).
  • Industrias: fintech (24), salud (13), retail/e-commerce (17), legal/servicios (10), SaaS B2B (14), gobierno/educación (9).
  • Criterio de inclusión: al menos un agente LLM en producción por 3+ meses.
  • Instrumento: cuestionario de 40 preguntas + entrevista de 45 min con el líder técnico.
  • Periodo de campo: enero-marzo 2026.
  • Datos anónimos agregados; el dataset curado se publica bajo CC-BY en github.com/numoru-ia/latam-ai-agents-survey-2026.

Perfil de los agentes desplegados

Casos de uso principales

Caso de uso% empresas
Soporte al cliente (texto)58%
Generación de contenido interno47%
Asistente de ventas / SDR31%
Agente de búsqueda sobre documentos internos (RAG)44%
Automatización de operaciones backoffice28%
Agente de voz (call center, recepción)14%
Compliance / revisión legal9%
Agente de código22%
Multi-agente orquestado17%

Nota: las empresas promedian 2.3 agentes cada una; por eso los porcentajes suman >100.

Madurez de deployment

  • 43% son prototipos expuestos a <100 usuarios internos.
  • 38% están en producción pero en un único canal o equipo.
  • 19% están en producción multicanal con métricas de negocio conectadas.

Solo el último tercio reporta ROI medible.

Stack: qué usa realmente LATAM

Orquestación y frameworks

Framework% uso primario
LangGraph38%
CrewAI21%
Custom (Go/TS propios)19%
AutoGen8%
Mastra (TS)7%
Pydantic AI5%
Otros (Haystack, Semantic Kernel)2%

LangGraph domina en sectores regulados (necesitan checkpointer, replay y controles finos). Custom sobresale en fintechs y equipos con ingeniería senior que ya tienen infraestructura Go robusta.

Vector databases

Vector DB% uso primario
Qdrant34%
pgvector (Postgres)27%
Weaviate14%
Pinecone11%
Chroma6%
Milvus5%
Otros3%

Qdrant superó a pgvector por primera vez en nuestro panel. La razón citada: performance a volúmenes >1M vectores y soporte nativo de búsqueda híbrida. pgvector sigue siendo fuerte en equipos con equipo DBA maduro y volúmenes <500k.

Observabilidad

Herramienta% uso primario
Langfuse (self-hosted u OSS)41%
LangSmith18%
Phoenix (Arize)9%
OpenLLMetry + Grafana8%
Helicone5%
Nada formal14%
Otros5%

Langfuse triplicó share año contra año. La razón: licencia Apache 2.0, opción self-hosted (crítica para compliance), y un ecosistema de integraciones que maduró en 2025.

El 14% que declara "nada formal" es casi idéntico al grupo que no reporta ROI. Correlación interesante.

Modelos más usados

Modelo (por volumen de inferencia)%
Claude Sonnet34%
GPT-4o / GPT-4o-mini28%
Claude Haiku12%
Llama 3.3 (local)9%
Gemini8%
Qwen 2.5 (local)4%
Otros5%

Claude domina en sectores regulados por políticas de retención y soporte fuerte para tool use. GPT lidera en agentes de voz y chatbots de consumer. Modelos locales (Llama, Qwen) crecen fuerte en salud y legal.

Otras piezas del stack

  • Redis como cache semántico o memoria: 52% lo usa.
  • LiteLLM como gateway: 29% (creció rápido en 2025).
  • MCP en producción: 18% (vs 2% hace un año).
  • Mem0 / Zep para memoria semántica: 14%.
  • Temporal / Inngest para flujos durables: 11%.
  • Guardrails (NeMo, Guardrails AI): 23%.

ROI: qué separa al 23% del resto

Comparando el grupo "ROI claro" contra el resto, cinco factores aparecen con significación estadística:

1. Tienen evaluación sistemática (p < 0.01)

El 86% del grupo ROI tiene evals automatizados en CI/CD. Del resto, solo 19%. La moraleja: sin medir, no se mejora.

2. Observabilidad productiva (p < 0.01)

95% del grupo ROI usa Langfuse, LangSmith o Phoenix. Del resto, 52%. La visibilidad en producción es la diferencia entre corregir a tiempo y acumular deuda.

3. Stack tiered de memoria (p < 0.05)

58% del grupo ROI combina working memory + sessions + memoria semántica. Del resto, 21%. Agentes sin memoria estructurada pierden relevancia a partir del turno 10-15.

4. Guardrails en producción (p < 0.05)

48% del grupo ROI tiene guardrails activos (contenido, topic, PII). Del resto, 17%. Menos errores visibles al usuario = más confianza operativa.

5. Dueño único del agente (p < 0.05)

74% del grupo ROI tiene un dueño técnico-funcional nombrado (un PM de IA, líder de AI Ops o rol similar). Del resto, 36%. Sin dueño, el agente se degrada sin que nadie lo note.

Conclusión directa: no es el framework. Es la disciplina operativa. Un equipo con Langfuse + evals + memoria tiered + guardrails + dueño puede usar cualquier framework y le irá bien.

Barreras principales (self-reported)

Barrera% empresas que la mencionan
Integración con sistemas existentes46%
Costos de inferencia38%
Falta de evaluación sistemática34%
Data quality / preparación32%
Compliance / regulación27%
Talento escaso24%
Allucinaciones no controladas22%
Latencia19%
Adopción interna18%
Costo de infraestructura12%

La integración con sistemas existentes es #1 por un margen claro. Por eso nuestro trabajo reciente apunta a MCP templates estandarizados: estandarizar esa capa es lo que más palanca tiene a nivel ecosistema.

Por sector

Fintech (n=24)

  • Stack modal: LangGraph + Qdrant + Langfuse + Claude Sonnet.
  • Uso principal: scoring asistido, atención al cliente, KYC.
  • ROI reportado: 38%. Lidera el panel.
  • Diferenciador: ya tenían MLOps; agregar LLMOps fue incremental.

Salud (n=13)

  • Stack modal: LangGraph + Qdrant + Ollama (Llama 3.3 local) + Langfuse.
  • Uso principal: resúmenes clínicos, triaje, documentación.
  • ROI reportado: 15%. Más lento por compliance.
  • Dolor: HIPAA + LFPDPPP + (si exportan) AI Act. Stack 100% on-prem para casos sensibles.

Retail / e-commerce (n=17)

  • Stack modal: CrewAI + pgvector + LangSmith + GPT-4o-mini.
  • Uso principal: atención al cliente, recomendaciones, descripciones de producto.
  • ROI reportado: 24%.
  • Dolor: alto volumen de inferencia = costos preocupantes. Cache semántico con Redis ya es tendencia fuerte.
  • Stack modal: Custom Go/TS + Qdrant + Langfuse + Claude Opus.
  • Uso principal: drafting, revisión, búsqueda en documentación.
  • ROI reportado: 30%.
  • Dolor: confianza. Invierten mucho en evals y citaciones verificables.

SaaS B2B (n=14)

  • Stack modal: LangGraph + Qdrant + Langfuse + Claude Sonnet.
  • Uso principal: feature embebida en el producto (asistente in-app).
  • ROI reportado: 21%.
  • Dolor: diferenciar el asistente propio cuando Cursor/Claude ya son comodity.

Gobierno / educación (n=9)

  • Stack modal: Mezclado, muchos con GPT-4o y poco stack propio.
  • Uso principal: asistentes educativos, atención ciudadana.
  • ROI reportado: 11%. El más bajo.
  • Dolor: ciclos de compra largos, infraestructura rezagada.
Share de frameworks entre las 87 empresas LATAM del panel

Framework primario de orquestación reportado por empresa. Se permitieron múltiples respuestas en subproyectos; el primario se reporta aquí.

0%10%20%30%40%LangGraphCrewAIPropietario / customMastraAutoGenLlamaIndex agents38%21%19%11%8%3%

Encuesta Numoru LATAM AI Agents 2026. Dataset CC-BY.

Share de vector DB — split Qdrant / pgvector

Vector DB primaria por empresa. El liderazgo Qdrant vs pgvector depende del volumen de datos.

Encuesta Numoru LATAM AI Agents 2026.

Predicciones 2026-2027 (con base en el panel)

  1. Langfuse supera 60% de share en el panel antes de Q4 2026 — el self-host se vuelve default por compliance.
  2. MCP pasa de 18% a >40% en el panel — la estandarización acelera adopción.
  3. Modelos locales (Llama, Qwen) cruzan 25% por peso combinado de costos, privacidad y maduración de herramientas (Ollama + vLLM).
  4. Pipelines de evals en CI/CD se vuelven práctica estándar: correlacionan tan fuerte con ROI que los equipos serios ya los montan como parte del day-1.
  5. Dos patrones dominantes: a) agente único con MCP + tiered memory (PyMEs), b) multi-agente orquestado por LangGraph + Temporal (empresas medianas/grandes).

Recomendaciones accionables

Si estás empezando (0 agentes en producción)

  • Elegir un caso de uso con métrica clara (ej. tiempo de respuesta, CSAT).
  • Stack inicial: LangGraph + Qdrant + Langfuse + Claude Sonnet + Redis.
  • Montar evals y observabilidad desde el día 1.
  • Dueño único nombrado.

Si tienes 1-2 agentes en prototipo

  • Resolver integración con sistema de registro (CRM, ERP) vía MCP.
  • Introducir guardrails básicos.
  • Migrar de notebook/script a orquestador formal.

Si tienes producción pero ROI incierto

  • Auditoría de observabilidad — ¿hay trazas completas?
  • Revisar prompt y memoria — tiered memory o retirada.
  • Implementar evals de regresión en CI/CD.

Impacto de negocio

Business & commercial impact

Qué vende el reporte

Estos datos son un producto en sí mismos. Numoru los comercializa de cuatro formas: el PDF premium de 80 páginas para inversores y equipos ops, un módulo de benchmarking donde el cliente se compara contra el panel, suscripción licenciada de investigación para consultoras que quieren el CSV raw, y el motor de lead gen que alimenta a los otros servicios Numoru (RAG rescue, GEO, AI Act, voz). Los analistas enterprise pagan múltiplos de este ticket por reportes McKinsey / Gartner menos específicos a LATAM.

Quién compra research como este

Pricing de investigación por comprador (Numoru, 2026)

Equipos VC / PE
Due-diligence de landscape IA LATAM y pricing.
$2,400 / licencia
Anual
Estrategia enterprise (CIO)
Benchmarking de stack + análisis de peer-group.
$9,500 / engagement
Anual + add-ons
Consultoras boutique
Integrar data en sus decks de cliente.
$3,200 / licencia reseller
12 mo
Vendors (frameworks, vector DBs)
Co-marketing + derechos de cita de benchmark.
$15,000 – 50,000 / año
Acuerdo partner
Medios / publishers sectoriales
Licenciamiento de extractos + embed.
$800 / chart
Por uso

Benchmarks públicos comparables

Public case studyManagement consulting · Global · 2024-2025

McKinsey — State of AI (anual)

Challenge
Recopilar y publicar un panel global anual sobre adopción de IA en empresas.
Solution
McKinsey encuestó 1,491 empresas de 101 países en la edición 2024 y publicó shifts de adopción, ROI y cobertura funcional.
Results
Empresas usando gen-AI
72%
Subió desde 55% YoY
Empresas con beneficios en costo
42%
Funciones con IA
Citas del panel enterprise
1,000+
Académicas + industria
Public case studyVendor de framework · Global · 2024

LangChain — State of AI Agents

Challenge
Publicar encuesta anual framework-céntrica sobre qué rompe los despliegues de agentes.
Solution
LangChain encuestó a 1,300+ ingenieros y compiló popularidad de frameworks, adopción de observabilidad y top blockers.
Results
Respondedores
1,300+
Ing., researchers, PMs
Orgs con agentes en prod
51%
Industria-wide
Descargas del reporte
10k+
Primeros 30 días

Caso ilustrativo — reseller de suscripción de research

Illustrative caseConsultoría de estrategia · 14 consultores · $1.8M revenue · Colombia

Consultoría boutique (Bogotá) licenciando el research para su práctica de estrategia

Baseline
Data genérica de Forrester / IDC reutilizada en decks. Sin poder citar adopción específica LATAM. Perdieron 2 de 5 RFPs contra competidores con data propietaria.
Intervention
Licenciaron el dataset Numoru ($3,200 / año) con derechos de reseller. Co-brandearon un "LATAM AI Playbook" de 30 páginas encima y lo compartieron con 120 clientes.
Projected outcome (12 mo)
Win-rate de RFP
60% → 78%
En asks IA-adyacentes
Revenue de advisory attached
+$185,000
Año 1
Costo de licencia
−$3,200
/ año
Brand lift
Medible
2× invitaciones a conferencias
Contribución neta año 1
+$181,800
Neto de re-licenciamiento
Rangos de revenue attached anclados a benchmarks SCORE de agencias 2024. Caso sintético — no representa a un cliente específico de Numoru.

Calculadora ROI — enterprise licenciando el panel

Oficina CIO benchmarkeando contra el panel de 87 empresas (12 meses)

Payback: < 1
Assumptions
Presupuesto IA actual$1.8M / año
Overspend de stack vs mediana panel18%
Budget ajustable post-benchmark$320,000 / año
Lift en calidad de decisión12% mejor asignación
Fee de engagement Numoru$9,500
Tiempo analista interno40 h × $110
Fee reporte + engagement−$9,500
Tiempo interno−$4,400
Over-spend recapturado+$57,600
Mejores decisiones de stack (12% × $320k)+$38,400
Leverage negociación vendor+$24,000
Contribución neta año 1+$106,100

Tiers de pricing

Resumen público
$0descarga
Este artículo + los charts.
  • TL;DR + metodología
  • Highlights de stats core
  • Charts embedables con cita
  • Link al dataset CC-BY
Reporte completo
$1,200one-time
PDF 80 páginas + CSV.
  • Cross-tab: stack × ROI
  • Breakdowns por sector
  • 12 charts de appendix
  • CSV raw CC-BY-NC
  • Licencia de citación interna
Benchmark engagement
$9,500por engagement
Tu empresa vs el panel.
  • Comparación de stack y costo
  • Workshop ejec. 60 min
  • Miro board custom 15 páginas
  • Playbook de negociación vendor
  • Call de seguimiento 90 días
  • Re-benchmarking 1 año

Licencias reseller y partnership se cotizan aparte. Contactar ventas.

FAQ

¿La muestra es representativa?Es la muestra más grande disponible en LatAm sobre este tema. No es probabilística (reclutamiento por LinkedIn + referidos de clientes), por lo que conclusiones deben leerse como direccionales, no como estadística poblacional.

¿Qué tan comparables son los ROIs entre empresas?Pedimos "ROI claro definido por la empresa" y no impusimos fórmula. Algunas miden tickets reducidos, otras conversión, otras NPS. El 23% es el grupo que pudo defender números ante su comité.

¿Por qué Qdrant supera a pgvector ahora? Volumen de datos: cuando las colecciones pasan 1M vectores o se requiere búsqueda híbrida, la arquitectura Rust de Qdrant escala mejor. pgvector sigue siendo ideal en <500k y equipos que ya operan Postgres.

¿Claude vs GPT-4?Cada uno domina nichos. Claude en sectores con alta necesidad de tool use confiable y políticas de retención estrictas. GPT en voz y consumer chat. Muchos equipos usan ambos vía LiteLLM con fallback.

¿El stack OSS realmente compite con SaaS?Sí cuando el equipo tiene 1 persona con experiencia DevOps y cuando los volúmenes justifican el costo fijo. Por debajo de 50k inferencias/mes, SaaS suele ganar por simplicidad.

Próximos pasos

El dataset completo y el script reproducible están en github.com/numoru-ia/latam-ai-agents-survey-2026. Si tu empresa quiere participar en la edición 2026-H2 (campo septiembre-octubre), el formulario está abierto. Publicaremos segmentos adicionales si el tamaño muestral alcanza: foodtech, edtech, proptech y logística.

¿Quieres resultados así para tu empresa?

Iniciar conversación
Compartir