Cinco cosas que los líderes empresariales necesitan saber antes de desplegar agentes de IA
Intel realizó miles de experimentos con cargas de trabajo de IA agéntica y descubrió que la mayoría de las organizaciones están midiendo las cosas equivocadas. Esto es lo que realmente importa cuando se va más allá de los chatbots.

Puntos clave
- Intel realizó miles de experimentos de carga de trabajo de IA agéntica para medir cómo funcionan los agentes de IA en sistemas empresariales completos, no solo en respuestas de modelos de IA.
- La mayoría de las herramientas de evaluación existentes solo miden qué tan bien funciona el modelo de IA subyacente, sin captar la imagen del sistema más amplia.
- La métrica de capacidad correcta es agentes por CPU virtual (vCPU), una unidad informática que representa una porción del poder de procesamiento de un servidor, no la cantidad total de agentes.
- Monitorear el uso promedio de CPU (qué tan duro está trabajando el procesador de una computadora, en promedio) puede ocultar ralentizaciones graves; la latencia de tareas, el tiempo que realmente tarda una tarea en completarse, es una señal de alerta mejor.
- Distribuir cargas de trabajo entre múltiples servidores, en lugar de actualizar una máquina grande, suele ser el enfoque más económico y confiable para ejecutar agentes a escala.
Los agentes de IA son software que puede planificar y realizar tareas de múltiples pasos de forma independiente, reservando reuniones, triando tickets de soporte, ejecutando pruebas de código, sin que un humano haga clic en cada paso. Las empresas están apostando fuertemente por ellos. Pero nuevos hallazgos de Intel sugieren que la mayoría de las organizaciones están pensando en el problema de forma incorrecta.
Intel extendió Terminal-Bench, un marco de pruebas de código abierto utilizado para evaluar cómo se comportan los agentes de IA, agregando herramientas de generación de perfiles y telemetría detallada (datos recopilados sobre cómo se ejecuta realmente el software). El equipo ejecutó los agentes en tareas que van desde consultas de bases de datos hasta transcripción de video, y registró los resultados.
Los hallazgos se publicaron como una guía práctica para equipos de tecnología empresarial, y fueron publicados originalmente por MIT Technology Review como contenido patrocinado de Intel.
¿Qué están haciendo mal las empresas?
La mayoría de los equipos miden el modelo de IA en sí: ¿qué tan preciso es, qué tan rápido responde? Eso pierde la mayor parte de lo que hace que un agente sea lento o poco confiable en el mundo real.
Un agente hace mucho más que hablar con un modelo de lenguaje. Lee datos, llama a herramientas externas, verifica resultados e intenta de nuevo cuando algo se rompe. Cada uno de esos pasos consume tiempo y recursos computacionales. Intel descubrió que enfocarse solo en el rendimiento del modelo te dice casi nada sobre si tu flota de agentes resistirá la carga empresarial real.
Las seis métricas que Intel recomienda rastrear son: tasa de éxito de tareas, costo por tarea, tiempo por tarea, rendimiento de tareas (cuántas tareas completa el sistema en un período dado), densidad de agentes (agentes por vCPU) y latencia de extremo a extremo.
¿Cómo deben planificar los equipos la escala?
Dimensiona tu sistema por densidad de agentes, no por cantidad de agentes. Diez agentes ejecutándose en un servidor de 8 vCPU se comportan casi idénticamente a 20 agentes en un servidor de 16 vCPU, porque la densidad es la misma. Esta única idea permite a los arquitectos comparar diferentes tamaños de servidor de manera justa.
Los objetivos de densidad también dependen de lo que hagan los agentes. Los agentes que se comunican directamente con empleados necesitan tiempos de respuesta rápidos, por lo que mantienes la densidad baja. Los trabajos en lote de fondo, como flujos de trabajo automatizados de TI o ejecuciones de pruebas de código nocturnas, pueden ejecutarse con densidad más alta sin que nadie note un ligero retraso.
| Tipo de carga de trabajo | Densidad recomendada | Por qué |
|---|---|---|
| Copiloto interactivo / asistente orientado al usuario | Densidad más baja | El tiempo de respuesta es visible para los usuarios |
| Flujos de trabajo de TI por lotes o de pruebas | Densidad más alta | Los ligeros retrasos son aceptables |
| Tareas de computación paralela pesada | Escalar hacia arriba (servidor único más potente) | Necesita poder de procesamiento concentrado |
| La mayoría de otras cargas de trabajo empresariales | Escalar hacia afuera (más servidores) | Más económico, más resiliente, más fácil de crecer |
Sobre escalado: agregar más servidores (scale-out) supera a actualizar una única máquina potente (scale-up) para casi todas las cargas de trabajo agénticas estándar. Los agentes son en gran medida independientes entre sí, por lo que distribuirlos entre máquinas mejora la disponibilidad y mantiene los costos más bajos a medida que crece la flota.
¿Qué significa esto para las personas que ejecutan estos sistemas?
Vigila la latencia de tareas P95, el tiempo en el que el 95 por ciento de las tareas han finalizado, en lugar del uso promedio de CPU. El uso promedio se ve bien justo hasta el momento en que se acumulan colas y los usuarios comienzan a esperar. La latencia P95 detecta ese problema antes.
Las organizaciones que ven resultados reales no están ejecutando experimentos. Están envolviendo agentes alrededor de flujos de trabajo que ya tienen reglas claras: revisión de código, pruebas de regresión (verificaciones automatizadas de que el software nuevo no ha roto características antiguas), triaje de tickets y auditorías de seguridad. Esos son los lugares donde los agentes producen ganancias de productividad medibles sin requerir que la organización replantee todo de una vez.
Preguntas frecuentes
¿Necesito hardware especial para ejecutar agentes de IA?
No necesariamente. Los hallazgos de Intel sugieren que agregar más servidores estándar (scale-out) funciona mejor que comprar una máquina muy potente para la mayoría de cargas de trabajo de agentes. El hardware especializado vale la pena considerarlo solo cuando los agentes necesitan computación paralela pesada o comparten estado de maneras que hacen que dividirlos entre servidores sea impracticable.
¿En qué se diferencia un agente de IA de un chatbot?
Un chatbot responde preguntas. Un agente planifica una secuencia de pasos, utiliza herramientas como bases de datos o compiladores de código, verifica si cada paso funcionó e intenta de nuevo si no fue así. Esa complejidad adicional es por qué ejecutar agentes bien requiere pensar en todo el sistema, no solo en el modelo de IA en su centro.
¿Estos hallazgos están revisados por pares?
No. Este trabajo proviene de los propios experimentos internos de Intel y se publicó como contenido patrocinado por un vendedor. El marco Terminal-Bench subyacente es de código abierto y está disponible para revisión independiente, pero los hallazgos específicos no han sido replicados de forma independiente ni publicados en una revista revisada por pares.



