Un round de financiamiento que revela dónde está el valor real de la IA

¿Cuánto vale una empresa que no fabrica modelos de inteligencia artificial, sino que se dedica a algo aparentemente menos glamoroso: preparar datos de entrenamiento complejos? La respuesta, según Reuters, es 3.500 millones de dólares. En septiembre de 2026, la startup Snorkel AI cerró una ronda de 350 millones de dólares liderada por Insight Partners y S32, alcanzando una valoración de 3.500 millones de dólares —casi el triple de los 1.300 millones que alcanzó cuando levantó 100 millones en mayo de 2025, según reportó Reuters. Su CEO, Alex Ratner, dijo al medio que su tasa de ingresos anualizada superó los 350 millones de dólares, impulsada por la demanda de los laboratorios de IA fronteriza por datos de entrenamiento cada vez más complejos y entornos simulados.

Este dato condensa una verdad incómoda para las empresas que corren a adoptar IA: el modelo que use importa menos que los datos con los que lo alimente. La ventaja competitiva ya no está en el algoritmo —que cada vez es más commodity— sino en los datos que solo su empresa posee y entiende.

Calidad sobre cantidad: lo que la ciencia de materiales enseña al mundo empresarial

Existe una tentación natural en cualquier proyecto de Big Data: acumular más datos, más registros, más fuentes. Pero la investigación científica más reciente sugiere que esa intuición puede estar equivocada.

Un análisis publicado en npj Energy Materials sobre campos de fuerza de machine learning para materiales electroquímicos llegó a una conclusión que trasciende la física: los marcos cristalinos de los electrolítos sólidos favorecen un aprendizaje eficiente, y lo que debe priorizarse es la calidad de los datos sobre la cantidad (Nature). En otras palabras, en dominios con estructura, un conjunto de datos pequeño pero bien curado rinde más que un océano de información mediocre.

La analogía es simple: preparar datos es como cocinar. Un chef con diez ingredientes frescos y bien seleccionados crea un plato superior al de otro que tiene cien ingredientes en distinto grado de descomposición. En las organizaciones pasa lo mismo: un data warehouse de tamaño modesto, con datos limpios, consistentes y con contexto de negocio, alimenta mejores modelos de IA que un lago de datos gigante lleno de duplicados, campos vacíos y definiciones contradictorias.

El mismo estudio de npj Energy Materials ofrece una segunda lección, menos conocida pero igual de crítica: las métricas técnicas de un modelo no predicen necesariamente su desempeño en la aplicación real. Los autores demostraron que el error cuadrático medio de fuerzas (force RMSE) no predice de forma confiable el rendimiento en transporte iónico del material. Traducido al lenguaje empresarial: una métrica impresionante en el laboratorio no garantiza resultados en producción. Las empresas deben evaluar sus modelos de IA con métricas de negocio, no solo con métricas estadísticas.

El problema de la generalización: cuando el modelo funciona en un lugar y falla en otro

Quizás el hallazgo más relevante para tomadores de decisiones proviene de la medicina. Un estudio publicado en Scientific Reports evaluó el modelo LiSep LSTM —una red neuronal diseñada para predecir tempranamente el shock séptico— entrenado con la base de datos estadounidense MIMIC-III, pero probado en una cohorte europea independiente del AmsterdamUMC (Nature).

El estudio examinó el impacto del distributional shift —el desplazamiento en la distribución de los datos entre poblaciones— mediante validación interna, externa y agrupada, y aplicó importancia de características por permutación para cuantificar la contribución de cada variable. La conclusión central: los modelos entrenados en una población no necesariamente generalizan a otra, porque los datos de cada cohorte tienen heterogeneidades propias.

Para una empresa latinoamericana, la implicancia es directa. Un modelo de scoring crediticio, detección de fraude o predicción de demanda entrenado con datos de Estados Unidos, Europa o incluso de otro mercado de la región puede degradar seriamente su rendimiento al enfrentarse a consumidores, idiomas, comportamientos de compra o regulaciones locales. Este es precisamente el argumento a favor de construir capacidades internas de datos: nadie más tiene los datos de sus clientes, de su operación, de su contexto.

El caso Databricks: por qué las empresas están unificando datos, agentes y análisis

La adquisición más reveladora del ecosistema de datos en 2026 no fue la compra de un laboratorio de IA, sino de una startup de hojas de cálculo. En septiembre de 2026, Databricks anunció la compra de Row Zero, una herramienta cloud que escala más allá de un millón de filas vivas en una hoja de cálculo, según reportó TechCrunch.

La historia detrás del acuerdo es aleccionadora: el equipo financiero de la propia Databricks estaba usando Row Zero combinada con Genie, su agente de IA interno, para responder preguntas complejas de negocio sobre sus datos mediante lenguaje natural. El CEO de Databricks, Ali Ghodsi, lo resumió en X: las hojas de cálculo son una interfaz que todo analista de negocio ama, y tiene sentido unir BI, agentes y hojas de cálculo.

Databricks no es cualquier comprador: según TechCrunch, la compañía cerró otros 5.000 millones de dólares en financiamiento en agosto de 2026 y ha estado muy activa comprando empresas. Ese mismo año ya había adquirido Quotient AI (evaluación y aprendizaje por refuerzo para agentes), SiftD.ai (notebooks interactivos), Panther (centro de operaciones de seguridad con IA) y Electric, creadores de PGlite, una base de datos Postgres ligera útil para agentes que corren localmente en dispositivos. Ghodsi afirmó a TechCrunch que la compañía planea seguir adquiriendo startups.

La lección para el CIO latinoamericano: la tendencia es que el dato permanezca seguro y centralizado en la plataforma de datos, mientras que agentes de IA y humanos interactúan con él a través de interfaces familiares —lenguaje natural, hojas de cálculo— sin que la información salga de un entorno controlado. Esto resuelve el problema más común de gobierno de datos empresarial: el usuario que exporta datos sensibles a una hoja de cálculo y la comparte por correo.

El talento que su empresa realmente necesita (y no es el que cree)

Un dato contraintuitivo publicado por el CMO de Indeed en Business Insider: las ofertas de trabajo en marketing se mantienen aproximadamente 25% por debajo de los niveles previos a la pandemia, y han caído más rápido que casi cualquier otra función de cuello blanco en los últimos cinco años. Sin embargo, las publicaciones de puestos de marketing que mencionan IA están aumentando.

Lo que cambia no es la importancia del marketing, sino el tipo de profesional que las empresas buscan. La misma ejecutiva planteó una convicción que debería tatuese todo directorio de la región: no se puede subcontratar la interpretación de los propios datos. Indeed decidió internalizar sus capacidades de analítica de marketing y ciencia de datos, porque ningún tercero puede comprender tan bien el negocio, los clientes y la estrategia. Al tomar control de sus modelos de mezcla de marketing, identificaron canales heredados que ya no generaban crecimiento de clientes significativo —desconexiones que, dejadas sin atender, conducen a decisiones costosas.

Esta tensión es especialmente aguda en Latinoamérica, donde la dependencia de proveedores extranjeros es una constante histórica. La experiencia de Indeed sugiere una vía intermedia realista para la región: los socios externos pueden aportar la plataforma y el arranque técnico, pero el contexto de negocio y la interpretación estratégica deben quedarse adentro. Si todos tienen acceso a las mismas herramientas de IA —argumenta la ejecutiva— la ejecución deja de ser el diferenciador; lo es el juicio humano.

La IA aplicada ya entrega resultados medibles en dominios difíciles

Los papers publicados en 2026 muestran que el aprendizaje automático ya no es promesa: es herramienta de trabajo en dominios complejos.

En salud, un estudio publicado en Scientific Reports desarrolló un modelo no invasivo para detección temprana de cánceres gástricos y colorrectales mediante perfilado de glicopéptidos séricos y machine learning. Con 550 participantes —275 pacientes con confirmación patológica y 275 controles sanos— el estudio cuantificó 28 glicopéptidos candidatos con una plataforma ELISA de alto rendimiento y comparó cuatro modelos: Regresión Logística, Máquina de Vectores de Soporte, Random Forest y XGBoost (Nature).

En sostenibilidad, otro estudio de Scientific Reports presentó un framework FA–ACO–LSTM para predecir emisiones de CO₂ a nivel de vehículo usando 22.556 registros del registro canadiense oficial de consumo de combustible, combinando selección de características con algoritmo Binary Firefly, ajuste de hiperparámetros con optimización Firefly–Ant Colony, e interpretabilidad posterior (Nature). Y en gestión de riesgo climático, un artículo de Nature Machine Intelligence propuso machine learning probabilístico para cerrar la brecha de resolución entre los modelos climáticos globales y la información de escala regional que requieren los tomadores de decisiones (Nature).

El patrón común: dominios con datos públicos o institucionales abundantes y bien estructurados avanzan más rápido. Las empresas de la región pueden replicar esta lógica con sus propios datos operativos —logística, energía, agroindustria, banca— sin necesidad de presupuestos de laboratorio fronterizo.

Pasos concretos para su empresa

  1. Audite la calidad antes de comprar más almacenamiento. Antes de invertir en infraestructura adicional, evalúe completitud, consistencia y trazabilidad de sus datos actuales. La evidencia científica reciente respalda priorizar calidad sobre volumen.
  2. Identifique sus datos propietarios e insustituibles. Los registros de interacción con clientes locales, datos operativos y contexto regulatorio regional son su activo diferencial frente a cualquier modelo genérico global.
  3. Evalúe modelos externos contra datos propios antes de producción. Como demostró el estudio LiSep LSTM, un modelo puede funcionar bien en una población y degradar en otra. Exija validación con datos locales antes de confiar en cualquier solución preentrenada.
  4. Centralice los datos y descentralice el acceso. Siga el patrón Databricks: los datos permanecen seguros en una plataforma gobernada, mientras los usuarios acceden mediante interfaces familiares como lenguaje natural o hojas de cálculo conectadas.
  5. Construya interpretación interna, no solo infraestructura. Como decidió Indeed, la lectura estratégica de sus datos no debe subcontratarse completamente. Forme perfiles híbridos que sepan formular las preguntas correctas al negocio.
  6. Mida con métricas de negocio. La lección del force RMSE aplica a su organización: un modelo con métricas técnicas impecables puede fracasar en el impacto real. Defina KPIs de negocio antes de entrenar.
  7. Empiece por un dominio acotado. Elija un caso de uso concreto —predicción de demanda, detección de fraude, mantenimiento predictivo— con datos ya disponibles y mida resultados antes de escalar.

Conclusión: el salto regional depende de la base de datos

Los mercados de datos de la región tienen una característica paradójica: la menor saturación tecnológica es una oportunidad. Las empresas latinoamericanas no necesitan replicar veinte años de legados digitales; pueden diseñar sus plataformas de datos desde el inicio con la IA como ciudadana de primera clase, con validación local, gobierno centralizado y capacidades interpretativas internas.

La ola de inversión de 2026 —Snorkel AI valorada en 3.500 millones de dólares, Databricks en plena etapa de expansión— confirma que el dinero sigue a los datos, no a los modelos. La pregunta que cada directorio de la región debería hacerse no es qué modelo de IA comprar, sino: ¿cuánto valdrían los datos de su empresa si mañana todos sus competidores usaran exactamente las mismas herramientas que usted?

Si su organización está replanteando su estrategia de datos para la era de la IA, puede explorar más análisis sobre transformación digital e IA empresarial en sistemasconsultores.com.


Artículo elaborado con asistencia de IA. Cada dato fue verificado contra las fuentes enlazadas; si encuentras un error, escríbenos.