Cuando los agentes de IA ya desarrollan a sus sucesores: qué nos dice la investigación de 2026

Menos de la mitad de los pilotos de IA empresarial llega a producción, según la encuesta de la firma de capital de riesgo Madrona a 150 profesionales de TI corporativa. Y aun los que despegan compiten en un mercado donde el 77% de las empresas reevalúa a sus proveedores de IA cada seis meses o de forma continua. ¿Qué separa a los proyectos que generan valor real de los que se quedan en el piloto? La investigación académica y de la industria publicada en los últimos meses ofrece pistas inesperadas — y ninguna tiene que ver con elegir el modelo más potente.

Este artículo sintetiza cinco hallazgos de papers recientes de arXiv, reportes de TechCrunch y Business Insider, y los traduce en implicaciones concretas para las empresas de Latinoamérica, donde los presupuestos son más ajustados y el margen de error, más pequeño.

El costo oculto del razonamiento sobre datos no estructurados

El primer hallazgo viene de un paper de arXiv sobre agentes de razonamiento eficientes en tokens (Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data). El problema que aborda es familiar para cualquier empresa: la mayor parte del conocimiento valioso — contratos, reportes, llamadas de ganancias, PDFs, páginas web — vive en fuentes no estructuradas, y la gran apuesta de la IA empresarial es desplegar agentes que razonen sobre esos datos.

El problema: el costo. Cada pregunta puede obligar al agente a abrir documentos enormes repetidamente para recuperar evidencia dispersa, consumiendo hasta un millón de tokens. En cambio, si los datos ya estuvieran estructurados, la misma pregunta se reduciría a una consulta de base de datos barata. En el benchmark FanOutQA, razonar sobre un almacén idealmente pre-estructurado es 28 veces más barato.

Pero estructurar todo por adelantado no es viable: los documentos contienen muchísima más estructura posible de la que cualquier carga de trabajo usará, y nadie sabe qué estructura será útil hasta que llegan las consultas. La solución propuesta, llamada agentic data cracking, es elegante: cuando el agente abre un documento para responder, un sub-agente se bifurca del contexto ya cargado — a costo marginal — y extrae estructura fundada que probablemente servirá a consultas futuras relacionadas. El estructurado es adaptativo (las consultas observadas deciden cuándo ocurre y qué importa) y especulativo (va más allá de la pregunta actual).

Los resultados: con apenas una pregunta relacionada adicional por pregunta de prueba, el cracking reduce el costo en 53% preservando la precisión. Con el tiempo, una porción creciente de consultas se responde sin abrir documento alguno, manteniendo la precisión agentic a un costo cercano al de RAG.

La metáfora útil: piense en una biblioteca donde cada vez que alguien consulta un libro, un asistente toma notas de las partes relevantes y las archiva en fichas catalogadas. La próxima consulta sobre ese tema ya no requiere reabrir el libro. El conocimiento que el razonamiento ya pagó por descubrir se acumula como infraestructura compartida.

Para una empresa latinoamericana con presupuesto ajustado, la implicación es directa: el costo por consulta de IA no es fijo, es una curva de aprendizaje. Diseñar la arquitectura para que cada uso haga más barato el siguiente uso es la diferencia entre un piloto costoso y un activo que se aprecia con el tiempo.

Un agente de IA sin memoria es un empleado con amnesia: Jev-Mem

El segundo paper (Jev-Mem: System-One-Controlled Agentic Memory), de investigadores de la Universidad de Texas en Dallas, aborda otro cuello de botella: la memoria agentic. Los agentes que operan en horizontes largos — asistentes de código, agentes personales, flujos de trabajo autónomos — acumulan preferencias de usuario, historial de tareas y conocimiento del entorno que exceden rápidamente cualquier ventana de contexto. Y agrandar el contexto nominal no resuelve el problema: los modelos no explotan de forma confiable todas las posiciones de una entrada larga.

El problema de muchas arquitecturas de memoria existentes es que usan LLMs autorregresivos para controlar cómo se organizan, recuperan y usan los recuerdos — colocando generación costosa en la ruta crítica de cada operación de memoria. Jev-Mem se inspira en la distinción cognitiva Sistema 1/Sistema 2: un controlador de Sistema 1, liviano y rápido, gobierna el tipado de memoria, el enrutamiento de consultas, la asignación de presupuesto de recuperación y la detención adaptativa; el Sistema 2 — el razonamiento deliberativo — solo se invoca para razonamiento complejo y síntesis de respuestas.

Los números hablan solos: en el benchmark LoCoMo, Jev-Mem logra un score de 0.777 como juez-LLM, una mejora relativa del 11% sobre el baseline más fuerte, mientras reduce el tiempo de construcción de memoria a 158 segundos (6.6 veces más rápido que el sistema de memoria competidor más veloz) y la latencia promedio de consulta a 0.93 segundos, 36.7% menos.

La lección para la empresa: la eficiencia no está solo en el modelo, está en la arquitectura que lo rodea. Un agente caro y lento no es un problema de modelo; es un problema de diseño.

Simulación antes de servir: el caso de Nubank y sus agentes de CX a escala de 140 millones

Si hay un caso de uso que demuestra el valor de la investigación en producción, es el paper Screen Before You Serve, que documenta el trabajo de Nubank con su agente de soporte de chat de mayor volumen en Brasil: Card Delivery y su sucesor, Card Management.

Mejorar agentes de experiencia del cliente (CX) es difícil, especialmente en industrias reguladas: deben detectar intención, seguir políticas operativas complejas y usar herramientas de forma confiable. Las pruebas manuales ofrecen cobertura limitada; los experimentos en vivo exponen a los clientes a fallos que erosionan la confianza.

La solución de Nubank: un flujo de simulación basado en hipótesis. Clientes sintéticos reaccionan a las respuestas del agente y las salidas simuladas de herramientas permiten flujos agentic de múltiples pasos sin invocar los sistemas de producción. A través de 4 versiones desplegadas, los puntajes simulados y de producción mostraron alta correlación.

Los resultados en pruebas A/B en vivo: la iteración guiada por simulación aumentó el net promoter score transaccional (tNPS) en 36.69 puntos. Tras evaluar más de 16,000 conversaciones simuladas para elegir configuraciones de modelos de peso abierto, el modelo seleccionado en producción elevó la tasa de autoservicio (SSR) en 8.82 puntos porcentuales — el nivel más alto jamás observado en Nubank — sin cambio estadísticamente significativo en tNPS.

Este caso es especialmente relevante para las empresas de la región porque demuestra que la simulación permite explorar modelos, configuraciones de razonamiento y prompts sin exponer a los clientes — algo crítico donde la confianza del consumidor, una vez perdida, no se recupera fácil. Para empresas de la región con equipos de datos pequeños, la simulación es una forma de hacer mucho más con menos.

El nuevo trabajo humano: gerentes de agentes sin el título ni el aumento

La investigación Atria Dawn, de un equipo que incluye al Shanghai AI Laboratory, examina qué pasa cuando los agentes de IA participan en el desarrollo de sus propios sucesores. Analizaron 769 registros de tareas de 56 participantes en un proyecto real de desarrollo de modelos. Los participantes calificaron aproximadamente un tercio de las tareas completadas con asistencia de IA como inviables sin IA. Pero el hallazgo más revelador: los agentes proponen métodos y ejecutan revisiones con frecuencia, mientras los humanos retienen la mayoría de las decisiones finales y guían la exploración mediante juicio y retroalimentación. Los autores lo describen como un cambio de la ejecución a nivel de tarea hacia la asociación a nivel de proyecto, con el esfuerzo humano concentrado en qué vale la pena perseguir y cómo la evidencia debe guiar la investigación.

Esto conecta con lo que reporta Business Insider: supervisar equipos de bots de IA se está convirtiendo en una habilidad laboral sin el salario de gerente. En Daytona, una startup de IA de 30 personas, cada uno de sus 16 ingenieros maneja en promedio cinco agentes de IA, y según su CEO ya nadie escribe código. Wipro, según su directora de tecnología Sandhya Arun, ha aumentado la productividad mediante IA en el equivalente de 20,000 trabajadores, y visualiza "al mismo ingeniero manejando un grupo de agentes".

La ingeniera de software Sinda Khenine, de Electrolux, lo describe bien: "El esfuerzo está más enfocado en la coordinación misma que en el problema de ingeniería que estamos resolviendo en primer lugar".

Aquí hay una tensión real que las empresas deben nombrar: los trabajadores se convierten en gerentes de facto sin compensación ni reconocimiento. Ignorar esta brecha no es solo un riesgo de talento; es una receta para la resistencia al cambio que ya es uno de los mayores obstáculos de la transformación digital en la región.

Un mercado sin foso defensivo: por qué la infraestructura importa

El reporte de TechCrunch sobre la investigación de Madrona describe una dinámica de "entra rápido, sale rápido" fundamentalmente distinta al SaaS tradicional: los costos de cambio son más bajos y la cadencia de reevaluación es implacable. IDC proyecta que las empresas gastarán $4.25 billones de dólares en tecnología en 2026, casi todo impulsado por IA, y el 74% de los profesionales encuestados planea expandir sus presupuestos de IA en los próximos 12 meses.

Mientras tanto, Ema recaudó $77 millones por sus "empleados de IA" — sistemas que coordinan múltiples agentes para procesos de negocio multi-etapa, con más de un millón de usuarios empresariales activos y clientes como NTT DATA, Hitachi, ADP y PwC. Su fundador, Surojit Chatterjee, ve a los clientes reduciendo dependencia de aplicaciones SaaS tradicionales que, en sus palabras, se están convirtiendo "mayormente como una base de datos".

La investigación de a16z citada por TechCrunch añade otra pieza: más de la mitad de los 50 compradores técnicos de IA encuestados quieren que los honorarios se vinculen al trabajo producido o a resultados — reportes procesados, tickets cerrados, leads generados — no al consumo de tokens.

Para el comprador empresarial latinoamericano, esto se traduce en una regla práctica: negocie por resultados, no por tokens, y no construya sobre un proveedor sin alternativa. La dependencia de proveedores extranjeros es un riesgo estructural en la región; mitigarlo exige arquitecturas capaces de cambiar de modelo sin reescribir todo — exactamente lo que el paper de data cracking y Jev-Mem hacen posible.

Pasos concretos para su empresa

  1. Mida el costo por consulta, no solo la precisión. Antes de escalar un piloto de IA sobre documentos, calcule cuánto cuesta responder una pregunta típica. Si cada consulta reabre documentos completos, está quemando presupuesto.

  2. Diseñe para que el sistema mejore con el uso. Adopte el principio del data cracking: capture estructura de los documentos que ya procesó para que consultas futuras sean consultas baratas, no razonamientos costosos repetidos.

  3. Separe lo rápido de lo deliberativo. Como Jev-Mem, reserve el modelo costoso solo para razonamiento complejo; use componentes livianos para enrutamiento, recuperación y decisiones operativas.

  4. Simule antes de exponer al cliente. Siga el modelo de Nubank: pruebe configuraciones, prompts y modelos en conversaciones sintéticas antes de desplegarlas ante clientes reales, especialmente si opera en una industria regulada.

  5. Rediseñe roles, no solo herramientas. Reconozca formalmente la función de orquestación de agentes — con título, expectativas claras y compensación — antes de que la resistencia al cambio sabotee la adopción.

  6. Negocie precios atados a resultados. Exija que el costo de su proveedor de IA refleje el trabajo producido (tickets cerrados, reportes generados), no el consumo de tokens.

  7. Evite el encadenamiento a un solo proveedor. Elija arquitecturas que le permitan cambiar de modelo o proveedor — la reevaluación cada seis meses es la nueva normalidad.

Conclusión: la pregunta que su junta directiva debería hacer

La investigación de 2026 dibuja un cuadro coherente: el valor de la IA empresarial ya no está solo en el modelo, sino en la arquitectura alrededor de él — memoria que aprende, estructura que se acumula, simulación que elimina el riesgo y humanos que dirigen en lugar de ejecutar. Para las empresas de Latinoamérica, con presupuestos limitados, escasez de talento especializado y dependencia de proveedores extranjeros, estas decisiones de arquitectura son precisamente las que determinan si una inversión en IA se convierte en valor sostenido o en otro piloto que nunca llega a producción.

Si quiere explorar cómo aplicar estos hallazgos en su organización, puede encontrar más análisis e implementación de IA empresarial en sistemasconsultores.com. La pregunta que debería guiar su próxima inversión en IA no es "¿qué modelo compramos?", sino: ¿su arquitectura de IA es más barata y más inteligente hoy que hace seis meses? Si la respuesta es no, cada consulta que ejecute está financiando un pozo sin fondo.


Artículo elaborado con asistencia de IA. Cada dato fue verificado contra las fuentes enlazadas; si encuentras un error, escríbenos.