Cinq points essentiels que les dirigeants d'entreprise doivent connaître avant de déployer des agents IA

Intel a mené des milliers d'expériences sur des charges de travail IA autonomes et a découvert que la plupart des organisations mesurent les mauvaises métriques. Voici ce qui compte vraiment lorsque vous allez au-delà des chatbots.

AI2Day Newsdesk4 min read
A modern open-plan office interior photographed at eye level in natural daylight
Share

Points clés

  • Intel a mené des milliers d'expériences sur des charges de travail IA autonomes pour mesurer les performances des agents IA dans les systèmes d'entreprise complets, et pas seulement les réponses du modèle IA.
  • La plupart des outils d'évaluation existants mesurent uniquement la performance du modèle IA sous-jacent, ce qui escamote entièrement la vision globale du système.
  • La bonne métrique de capacité est le nombre d'agents par vCPU (unité de calcul représentant une part de la puissance de traitement d'un serveur), et non le nombre total d'agents.
  • Surveiller l'utilisation moyenne du processeur (l'intensité de travail moyenne d'un processeur) peut masquer des ralentissements graves ; la latence des tâches, le temps qu'une tâche met réellement à s'exécuter, est un meilleur indicateur d'alerte.
  • Répartir les charges de travail sur plusieurs serveurs, plutôt que de mettre à niveau une seule machine puissante, est généralement l'approche la moins chère et la plus fiable pour exécuter des agents à grande échelle.

Les agents IA sont des logiciels capables de planifier et d'exécuter des tâches multi-étapes de manière autonome, en programmant des réunions, en triant les tickets d'assistance, en exécutant des tests de code, sans qu'un humain ne clique sur chaque étape. Les entreprises misent gros sur eux. Mais une nouvelle série de conclusions d'Intel suggère que la plupart des organisations pensent au problème de manière incorrecte.

Intel a étendu Terminal-Bench, un cadre d'essai open-source utilisé pour évaluer le comportement des agents IA, en ajoutant des outils de profilage et des données de télémétrie détaillées (des données collectées sur le fonctionnement réel du logiciel). L'équipe a exécuté les agents sur des tâches allant des requêtes de base de données à la transcodage vidéo, puis a enregistré les résultats.

Les conclusions ont été publiées sous la forme d'un guide pratique pour les équipes technologiques d'entreprise, et ont été initialement présentées par MIT Technology Review comme contenu sponsorisé par Intel.

Qu'est-ce que les entreprises font mal ?

La plupart des équipes mesurent le modèle IA lui-même : quelle est sa précision, à quelle vitesse répond-il ? Cela fait abstraction de la plupart des éléments qui ralentissent ou rendent un agent peu fiable dans le monde réel.

Un agent fait bien plus que discuter avec un modèle de langage. Il lit des données, appelle des outils externes, vérifie les résultats et réessaie lorsque quelque chose se casse. Chacune de ces étapes prend du temps et des ressources de calcul. Intel a découvert que se concentrer uniquement sur la performance du modèle ne vous dit presque rien sur la capacité de votre flotte d'agents à supporter la charge métier réelle.

Les six métriques qu'Intel recommande de suivre sont : le taux de réussite des tâches, le coût par tâche, le temps par tâche, le débit des tâches (le nombre de tâches que le système complète dans une période donnée), la densité des agents (agents par vCPU) et la latence de bout en bout.

Comment les équipes devraient-elles planifier la scalabilité ?

Dimensionnez votre système selon la densité des agents, et non selon le nombre total d'agents. Dix agents exécutés sur un serveur 8-vCPU se comportent presque de manière identique à 20 agents sur un serveur 16-vCPU, car la densité est la même. Cette seule observation permet aux architectes de comparer équitablement différentes tailles de serveurs.

Les objectifs de densité dépendent aussi de ce que font les agents. Les agents qui communiquent directement avec les employés ont besoin de temps de réponse rapides, vous maintenez donc la densité basse. Les tâches par lot en arrière-plan, telles que les workflows informatiques automatisés ou les exécutions de test de code nocturnes, peuvent s'exécuter à une densité plus élevée sans que personne ne remarque un léger délai.

Type de charge de travail Densité recommandée Raison
Copilote interactif / assistant orienté utilisateur Densité basse Le temps de réponse est visible pour les utilisateurs
Workflows informatiques ou de test par lot Densité élevée Les légers retards sont acceptables
Tâches de calcul parallèle lourd Augmenter la puissance (serveur unique plus performant) Nécessite une puissance de traitement concentrée
La plupart des autres charges de travail d'entreprise Augmenter le nombre (plus de serveurs) Moins cher, plus résilient, plus facile à développer

En matière de scalabilité : ajouter plus de serveurs (augmentation horizontale) surpasse la mise à niveau d'une seule machine puissante (augmentation verticale) pour presque chaque charge de travail d'agent standard. Les agents sont largement indépendants les uns des autres, donc leur répartition sur plusieurs machines améliore la disponibilité et réduit les coûts à mesure que la flotte se développe.

Qu'est-ce que cela signifie pour les personnes qui gèrent ces systèmes ?

Surveillez la latence des tâches P95, le temps auquel 95 % des tâches sont terminées, plutôt que l'utilisation moyenne du processeur. L'utilisation moyenne semble correcte jusqu'au moment où les files d'attente s'accumulent et où les utilisateurs commencent à attendre. La latence P95 détecte ce problème plus tôt.

Les organisations qui voient des résultats concrets ne mènent pas d'expériences. Elles enroulent les agents autour de flux de travail qui ont déjà des règles claires : revue de code, test de régression (vérifications automatisées que le nouveau logiciel n'a pas cassé les anciennes fonctionnalités), triage des tickets et audits de sécurité. Ce sont les endroits où les agents produisent des gains de productivité mesurables sans obliger l'organisation à tout repenser d'un coup.

Questions fréquentes

Ai-je besoin d'un matériel spécial pour exécuter des agents IA ?

Pas nécessairement. Les conclusions d'Intel suggèrent que l'ajout de plus de serveurs standard (augmentation horizontale) fonctionne mieux que l'achat d'une seule machine très puissante pour la plupart des charges de travail des agents. Le matériel spécialisé n'est à considérer que lorsque les agents ont besoin d'un calcul parallèle lourd ou partagent un état d'une manière qui rend impossible de les répartir sur plusieurs serveurs.

En quoi un agent IA est-il différent d'un chatbot ?

Un chatbot répond aux questions. Un agent planifie une séquence d'étapes, utilise des outils tels que des bases de données ou des compilateurs de code, vérifie si chaque étape a fonctionné, et réessaie si ce n'est pas le cas. Cette complexité supplémentaire explique pourquoi l'exécution réussie des agents nécessite de penser au système entier, et pas seulement au modèle IA au centre.

Ces conclusions sont-elles issues de recherches évaluées par les pairs ?

Non. Ce travail provient des expériences internes propres à Intel et a été publié comme contenu sponsorisé par un fournisseur. Le cadre Terminal-Bench sous-jacent est open-source et accessible pour examen indépendant, mais les conclusions spécifiques n'ont pas été reproduites de manière indépendante ni publiées dans une revue évaluée par les pairs.

© 2026 AI2Day