El Agente Dijo que Estaba Hecho. La Base de Datos Sabía Mejor.
Un nuevo benchmark de Microsoft y Hugging Face ejecuta agentes de IA en tareas empresariales reales 20 veces cada una, luego verifica los registros que dejan. La mayoría de los modelos fallan mucho más a menudo de lo que sugiere una sola prueba.

Puntos clave
- ThinkingBox, un nuevo benchmark de agentes de IA construido por investigadores de Microsoft y lanzado a través de Hugging Face, prueba 507 flujos de trabajo empresariales reales y verifica el estado actual de la base de datos que un agente deja atrás, no solo si dio una respuesta educada.
- Claude Opus 5.5 obtuvo la puntuación más alta en general con 67,16% en un solo intento, pero conservó solo 71% de esa puntuación cuando cada tarea se ejecutó 20 veces seguidas.
- GPT-6 Astra fue el modelo más consistente probado, manteniendo 78% de su puntuación de un solo intento en todas las 20 repeticiones.
- En 121.680 ejecuciones de prueba, 67,24% de los intentos fallidos terminaron limpiamente sin error obvio, lo que significa que el agente parecía tener éxito mientras la base de datos decía lo contrario.
- Kimi-K3, un modelo de peso abierto que se ejecuta en su propio hardware sin suscripción, resolvió 93,89% del benchmark al menos una vez, la cobertura más amplia de cualquier modelo probado.
Un aparato de cocina de $745 de una cliente ha estado atrapado en un depósito de correo durante quince días. Un agente de IA maneja su queja. Nueve llamadas a herramientas: lee correctamente la política de reembolso, abre un ticket de soporte, lo cierra con un alegre "¿Hay algo más en lo que pueda ayudarlo?"
La excepción del transportista sigue abierta. Nunca obtuvo una respuesta real. La base de datos dice que el ticket está "resuelto" cuando debería estar "en espera".
Un AI que verificara las acciones del agente vería nueve pasos bien formados y declararía éxito. La base de datos no está de acuerdo.
Esa brecha es exactamente lo que ThinkingBox mide. Desarrollado por investigadores de Microsoft y lanzado a través de Hugging Face, el benchmark ejecuta agentes de IA (software que realiza tareas de múltiples pasos por sí solo) a través de 507 escenarios empresariales extraídos de retail, viajes, seguros de autos, neobancos y soporte de consultoría. Califica el estado real de una base de datos backend después de que el agente termina, no el texto de su respuesta final.
¿Por qué una ejecución exitosa no significa mucho?
El software real ejecuta la misma tarea miles de veces, no una sola. ThinkingBox ejecuta cada tarea 20 veces desde un estado limpio, luego hace tres preguntas: ¿con qué frecuencia el agente tiene éxito en un intento aleatorio, puede resolver esto en absoluto, y ¿lo acierta cada sola vez?
Los resultados son humillantes.
| Modelo | Pase general@1 | % de puntuación conservada en 20 ejecuciones |
|---|---|---|
| Claude Opus 5.5 | 67,16% | 71% |
| Claude Opus 5 | 66,50% | 71% |
| GPT-5.4 | 65,36% | no reportado |
| GPT-6 Astra | 58,31% | 78% |
| Kimi-K3 (peso abierto) | 57,37% | ~8% |
| DeepSeek-V4-Pro | 43,26% | ~8% |
GPT-6 Astra es el más consistente: mantiene 78% de su rendimiento de un solo intento en todas las 20 ejecuciones. Claude Opus 5.5 y Claude Opus 5 conservan cada uno 71%. En el extremo opuesto, Kimi-K3, GLM-5.1 y DeepSeek-V4-Pro retienen aproximadamente 8% cada uno, por lo que una puntuación que se ve razonable en un leaderboard colapsa casi completamente bajo repetición.
Kimi-K3 aún obtiene una distinción notable: resolvió 476 de 507 tareas al menos una vez, la cobertura más amplia en el campo. La amplitud y la confiabilidad no son lo mismo.
¿Qué significa esto para cualquiera que use herramientas de IA en el trabajo?
Versión simple: un asistente de IA que completa una tarea correctamente en una demostración puede no hacerlo de manera confiable en uso diario. Dos tercios de las ejecuciones fallidas en este benchmark terminaron sin error visible. La herramienta parecía estar bien; el registro real era incorrecto.
Para empresas que integran agentes de IA en atención al cliente o TI interna, es peor que eso. Nuestra historia del 2 de octubre sobre AutoSynthData de ServiceNow encontró que el modelo más fuerte probado completó apenas un tercio de tareas empresariales realistas. Estas cifras muestran una razón por qué: un modelo que maneja quejas de retail con precisión del 68% puede caer a 8% en reclamaciones de seguros de autos de la misma compañía.
El benchmark está disponible para ejecutar usted mismo a través de la plataforma OpenEnv vinculada en el documento de ThinkingBox en arxiv.org. No se requiere suscripción.
La lección que la industria sigue reaprendiendo: una respuesta confiada y un resultado correcto no son lo mismo. La única forma de saber cuál obtuvo es verificar lo que el sistema realmente escribió.
Preguntas comunes
¿Afecta esto a las herramientas de IA para consumidores como Claude o ChatGPT?
No directamente. ThinkingBox prueba agentes de IA integrados en software empresarial, no las aplicaciones de chat que la mayoría de las personas usan diariamente. Pero los mismos modelos alimentan ambos, por lo que los problemas de consistencia en un benchmark son una señal real sobre cómo se comportan esos modelos bajo presión.
¿Qué es un modelo de "peso abierto" y por qué importa aquí?
Un modelo de peso abierto es uno cuyo código subyacente se publica públicamente, por lo que una compañía o desarrollador puede ejecutarlo en sus propias computadoras sin una tarifa de suscripción. Kimi-K3 mostró la cobertura de tareas más amplia de cualquier modelo en el benchmark, lo que importa para organizaciones que buscan reducir costos, aunque su puntuación de consistencia es mucho más débil que la de los principales modelos propietarios.
¿Dónde puedo leer los resultados completos?
El documento completo, incluidas todas las tareas del benchmark y los rastros de falla, está disponible en arxiv.org.



