Cinco cosas que los líderes empresariales deben saber antes de implementar agentes de IA
Intel realizó miles de experimentos sobre cargas de trabajo de IA agéntica y descubrió que la mayoría de las organizaciones están midiendo las cosas equivocadas. Esto es lo que realmente importa cuando se va más allá de los chatbots.

Puntos clave
- Intel realizó miles de experimentos de carga de trabajo de IA agéntica para medir cómo funcionan los agentes de IA en sistemas empresariales completos, no solo en respuestas de modelos de IA.
- La mayoría de las herramientas de evaluación existentes solo miden qué tan bien funciona el modelo de IA subyacente, perdiendo completamente la imagen del sistema más amplia.
- La métrica de capacidad correcta es agentes por CPU virtual (vCPU), una unidad informática que representa una porción del poder de procesamiento de un servidor, no la cantidad total de agentes.
- Monitorear el uso promedio de CPU puede ocultar ralentizaciones graves; la latencia de tareas, el tiempo que realmente tarda en completarse una tarea, es una señal de alerta mejor.
- Distribuir cargas de trabajo en varios servidores, en lugar de actualizar una máquina grande, suele ser el enfoque más económico y confiable para ejecutar agentes a escala.
Los agentes de IA son software que puede planificar y ejecutar tareas de varios pasos de forma autónoma, reservando reuniones, clasificando tickets de soporte, ejecutando pruebas de código, sin que un humano haga clic en cada paso. Las empresas están apostando mucho por ellos. Pero los nuevos hallazgos de Intel sugieren que la mayoría de las organizaciones están pensando sobre el problema de manera incorrecta.
Intel extendió Terminal-Bench, un marco de prueba de código abierto utilizado para evaluar el comportamiento de agentes de IA, añadiendo herramientas de perfilación y telemetría (datos recopilados sobre cómo se está ejecutando el software). Las tareas iban desde consultas de bases de datos hasta transcodificación de video. Los hallazgos se publicaron como una guía práctica para equipos de tecnología empresarial y fueron destacados originalmente por MIT Technology Review como contenido patrocinado de Intel.
Es un patrón que nuestra historia anterior "Tu chatbot de IA no está roto. Tu canalización de datos sí lo está." capturó en julio: los equipos empresariales siguen culpando al modelo cuando el verdadero problema se encuentra en otro lugar del sistema.
¿Qué están haciendo mal las empresas?
La mayoría de los equipos miden el modelo de IA en sí: precisión y velocidad de respuesta. Eso se pierde la mayoría de lo que hace que un agente sea lento o poco confiable en la práctica.
Un agente hace mucho más que consultar un modelo de lenguaje. Lee datos, llama herramientas, verifica resultados e intenta de nuevo cuando algo se rompe. Cada paso toma tiempo y computación. Intel descubrió que el desempeño del modelo por sí solo te dice casi nada sobre si tu flota de agentes podrá soportar la carga empresarial real.
Las seis métricas que Intel recomienda rastrear son: tasa de éxito de tareas, costo por tarea, tiempo por tarea, rendimiento de tareas (cuántas tareas completa el sistema en un período determinado), densidad de agentes (agentes por vCPU), y latencia de extremo a extremo.
¿Cómo deben planificar los equipos la escalabilidad?
Dimensiona tu sistema por densidad de agentes, no por cantidad de agentes. Diez agentes en un servidor de 8 vCPU se comportan casi idénticamente a 20 agentes en un servidor de 16 vCPU, porque la densidad es la misma. Esa única perspectiva permite que los arquitectos comparen diferentes tamaños de servidor de manera justa.
Los objetivos de densidad también dependen de qué están haciendo los agentes. Los agentes que atienden a empleados necesitan tiempos de respuesta rápidos, por lo que mantienes la densidad baja. Los trabajos por lotes en segundo plano, como flujos de trabajo de TI automatizados o ejecuciones nocturnas de pruebas de código, pueden ejecutarse con mayor densidad sin que nadie note un ligero retraso.
| Tipo de carga de trabajo | Densidad recomendada | Por qué |
|---|---|---|
| Copiloto interactivo / asistente orientado al usuario | Densidad más baja | El tiempo de respuesta es visible para los usuarios |
| Flujos de trabajo de TI o pruebas por lotes | Densidad más alta | Los retrasos ligeros son aceptables |
| Tareas de computación paralela pesada | Escalar (servidor único más potente) | Requiere poder de procesamiento concentrado |
| La mayoría de otras cargas de trabajo empresariales | Escalar (más servidores) | Más económico, más resiliente, más fácil de crecer |
Agregar más servidores (escalamiento horizontal) supera a actualizar una máquina única (escalamiento vertical) para casi todas las cargas de trabajo agéntica estándar. Los agentes son en gran medida independientes entre sí, por lo que distribuirlos entre máquinas mejora la disponibilidad y mantiene los costos más bajos a medida que crece la flota.
¿Qué significa esto para las personas que ejecutan estos sistemas?
Observa la latencia de tarea P95, el tiempo en el que el 95 por ciento de las tareas se han completado, en lugar del uso promedio de CPU. El uso promedio se ve bien hasta el momento en que las colas se acumulan y los usuarios comienzan a esperar. La latencia P95 detecta ese problema antes.
Las organizaciones que ven resultados reales no están ejecutando experimentos. Están envolviendo agentes alrededor de flujos de trabajo que ya tienen reglas claras: revisión de código, pruebas de regresión (verificaciones automatizadas de que el nuevo software no ha roto funcionalidades antiguas), clasificación de tickets y auditorías de seguridad. Esos son los lugares donde los agentes producen ganancias de productividad medibles sin requerir que la organización replantee todo de una vez.
La lectura honesta sobre este informe: los hallazgos de Intel son direccionalmente sensatos y el marco Terminal-Bench es de código abierto, por lo que los equipos pueden verificar su estructura por sí mismos. Pero los números específicos no han sido replicados de forma independiente, y las empresas deben tratarlos como un marco inicial en lugar de puntos de referencia establecidos.
Preguntas comunes
¿Necesito hardware especial para ejecutar agentes de IA?
No necesariamente. Los hallazgos de Intel sugieren que agregar más servidores estándar funciona mejor que comprar una máquina potente para la mayoría de las cargas de trabajo de agentes. El hardware especializado vale la pena considerarlo solo cuando los agentes necesitan computación paralela pesada o comparten estado de maneras que hacen impracticable dividirlos en servidores.
¿En qué se diferencia un agente de IA de un chatbot?
Un chatbot responde preguntas. Un agente planifica una secuencia de pasos, utiliza herramientas como bases de datos o compiladores de código, verifica si cada paso funcionó e intenta de nuevo si no lo hizo. Esa complejidad adicional es por qué ejecutar agentes bien requiere pensar en todo el sistema, no solo en el modelo de IA en el centro.
¿Estos hallazgos son investigación revisada por pares?
No. Este trabajo proviene de los propios experimentos internos de Intel y fue publicado como contenido patrocinado por proveedores. El marco Terminal-Bench subyacente es de código abierto y está disponible para revisión independiente, pero los hallazgos específicos no han sido replicados de forma independiente ni publicados en una revista revisada por pares.



