Una Conversación Perfecta de IA Aún Puede Significar un Producto Roto, Advierten Líderes de la Industria
Ejecutivos de LangChain, Conviva y CoreWeave dicen que la mayoría de los equipos miden sus agentes de IA de forma incorrecta, y la solución tiene menos que ver con puntuaciones más inteligentes y más con comparar grupos de usuarios a lo largo del tiempo.

Puntos clave
- Harrison Chase, CEO de LangChain, dijo en VB Transform 2026 que muchos equipos sufren de "parálisis de evaluación" y nunca lanzan porque persiguen una suite de pruebas perfecta antes del lanzamiento.
- Hui Zhang, CTO de Conviva, demostró cómo una única conversación de IA puede tener una puntuación excelente de forma aislada mientras oculta un problema de toda la categoría visible únicamente al comparar miles de usuarios contra una línea base.
- LangChain ajustó un modelo de IA pequeño propio para detectar errores percibidos por usuarios a un costo entre 10 y 100 veces menor que usar Claude Sonnet de Anthropic, un modelo de IA comercial líder.
- Los tres ejecutivos estuvieron de acuerdo en que la aprobación humana sigue siendo esencial en campos regulados como legal, finanzas y atención médica, incluso cuando los controles automatizados se escalan.
Imagínese a un cliente que le pregunta a un asistente de compras impulsado por IA sobre zapatillas para correr antes de una media maratón. El asistente hace algunas preguntas, el cliente compra un par y la conversación termina. Puntúe esa interacción por sí sola: se ve bien.
Ahora mire el panorama completo. En miles de conversaciones similares, ese asistente hizo preguntas aclaratorias tres veces más frecuentemente de lo normal para esa categoría de zapatos. Los clientes completaron sus compras fuera del chat a una tasa cinco veces superior a la habitual. Algo claramente está roto. Pero nunca lo vería revisando una conversación a la vez.
Ese fue el argumento central hecho en VB Transform 2026, informado primero por VentureBeat, donde líderes de tres empresas de infraestructura de IA describieron cómo los equipos empresariales están evaluando agentes de forma muy incorrecta.
¿Están los equipos midiendo lo correcto?
La mayoría no. Hui Zhang, CTO de Conviva, una empresa de análisis de transmisión, denomina el mejor enfoque "análisis contrastivo": comparar un grupo de usuarios contra una línea base histórica en lugar de puntuar registros de chat individuales. Las puntuaciones únicas se ven bien. Los patrones de población revelan el error real.
Harrison Chase, CEO de LangChain, la empresa detrás de un marco popular para construir agentes de IA (software que puede realizar tareas de varios pasos por su cuenta), agregó una segunda trampa. Los equipos construyen suites de pruebas exhaustivas antes del lanzamiento, luego nunca lanzan.
"A veces vemos equipos que tienen casi parálisis de evaluación", dijo Chase. "Los mejores equipos lanzan e iteran".
Su marco: trate los criterios de evaluación como una especificación de producto viva que se actualiza a medida que surgen problemas reales, no como una lista de verificación que termina una sola vez.
Emmanuel Turlay, director de ingeniería en CoreWeave, un proveedor de GPU en la nube (GPU se refiere a los chips especializados que realizan el cálculo numérico pesado que necesita IA, chocó contra el mismo obstáculo desde el lado de la ingeniería. Persiguió cobertura de prueba del 100 por ciento y aún así envió errores. Su solución: configure el monitoreo amplio y siempre activo primero, deje que los errores reales le enseñen qué pruebas escribir a continuación.
Una vez que surge una categoría de problema, también tiene una pregunta de costo. La regla de Turlay es comenzar con el modelo de IA más capaz para probar que algo es solucionable, luego pasar a modelos más pequeños y baratos para controles de rutina. LangChain hizo exactamente eso. Ajustó un modelo Qwen (una familia de modelos de código abierto de Alibaba) para detectar momentos en que los usuarios sintieron que el agente cometía un error. El resultado coincidió con la precisión de Claude Sonnet a una fracción del precio. Chase señaló que algunas barreras de protección ni siquiera necesitan un modelo: el código simple de coincidencia de patrones, llamado regex, maneja muchas comprobaciones prácticamente sin costo.
La pregunta humana subyace en todo esto. Turlay se basó en su trabajo anterior en una empresa de automóviles autónomos: incluso después de comprimir el ciclo de prueba a dos semanas, una persona aún tenía que aprobar el modelo antes de que ingresara al vehículo. La misma lógica se aplica a agentes de IA que manejan asesoramiento médico, decisiones financieras o documentos legales.
Chase fue más allá, argumentando que la verificación humana no es solo una red de seguridad. Es cómo el sistema aprende. Sin retroalimentación humana en el bucle, el agente no tiene nada en qué mejorar.



