П'ять речей, які повинні знати лідери підприємств перед розгортанням AI агентів
Intel провів тисячі експериментів з робочими навантаженнями agentic AI і виявив, що більшість організацій вимірюють не те. Ось що насправді має значення, коли ви виходите за межі чатботів.

Ключові моменти
- Intel провів тисячі експериментів з робочими навантаженнями AI агентів, щоб виміряти продуктивність AI агентів у повних корпоративних системах, а не лише у відповідях моделей AI.
- Більшість існуючих інструментів бенчмаркування вимірюють лише те, наскільки добре працює основна модель AI, повністю игноруючи ширшу картину системи.
- Правильна метрика потужності — це агенти на віртуальний процесор (vCPU), обчислювальну одиницю, яка представляє одну частину потужності обробки сервера, а не загальну кількість агентів.
- Моніторинг середнього використання CPU (наскільки інтенсивно працює процесор комп'ютера в середньому) може замаскувати серйозні уповільнення; затримка завдання, час, необхідний для фактичного виконання завдання, є кращим сигналом попередження.
- Розподіл робочих навантажень між кількома серверами, а не оновлення однієї потужної машини, зазвичай є дешевшим і надійнішим підходом для запуску агентів у масштабах.
AI агенти — це програмне забезпечення, яке може планувати та виконувати багатокрокові завдання самостійно, бронювати зустрічі, сортувати квитки підтримки, запускати тести коду без людини, яка натискає на кожний крок. Підприємства багато інвестують у них. Проте нові висновки Intel вказують на те, що більшість організацій мислять про проблему невірно.
Intel розширив Terminal-Bench, фреймворк з відкритим кодом, який використовується для оцінки поведінки AI агентів, додавши інструменти профілювання та детальну телеметрію (дані, зібрані про те, як насправді працює програмне забезпечення). Команда запустила агентів у завданнях, починаючи від запитів до бази даних до транскодування відео, а потім записала результати.
Висновки були опубліковані як практичний посібник для корпоративних технічних команд і були першопочатково представлені MIT Technology Review як спонсоруваний контент від Intel.
Що компанії роблять неправильно?
Більшість команд вимірюють саму модель AI: наскільки вона точна, як швидко вона реагує? Це упускає більшість того, що робить агента повільним або ненадійним у реальному світі.
Агент робить набагато більше, ніж говорить з мовною моделлю. Він читає дані, викликає зовнішні інструменти, перевіряє результати та повторює спроби, коли щось зламується. Кожен з цих кроків займає час і обчислювальні ресурси. Intel виявив, що сфокусування лише на продуктивності моделі говорить вам майже нічого про те, чи витримає ваш парк агентів реальне бізнес-навантаження.
Шість метрик, які Intel рекомендує відстежувати: показник успіху завдання, вартість на завдання, час на завдання, пропускна здатність завдання (скільки завдань система виконує за визначений період), щільність агентів (агенти на vCPU) та наскрізна затримка.
Як командам планувати масштабування?
Розраховуйте розмір системи за щільністю агентів, а не за кількістю агентів. Десять агентів, які запущені на сервері з 8 vCPU, поводяться майже ідентично до 20 агентів на сервері з 16 vCPU, оскільки щільність однакова. Цей єдиний висновок дозволяє архітекторам справедливо порівнювати різні розміри серверів.
Цілі щільності також залежать від того, що роблять агенти. Агенти, які спілкуються безпосередньо з працівниками, потребують швидких часів відклику, тому ви тримаєте щільність низькою. Фонові пакетні завдання, такі як автоматизовані IT робочі процеси або нічні прогони тестування коду, можуть запускатися з вищою щільністю, не привертаючи уваги, якщо є невелика затримка.
| Тип робочого навантаження | Рекомендована щільність | Причина |
|---|---|---|
| Інтерактивний копілот / помічник для користувачів | Низька щільність | Час відповіді видимий користувачам |
| Пакетні IT або тестові робочі процеси | Висока щільність | Невеликі затримки прийнятні |
| Завдання важких паралельних обчислень | Масштабування вгору (більш потужний окремий сервер) | Потребує зосередженої обчислювальної потужності |
| Більшість інших корпоративних робочих навантажень | Масштабування ширше (більше серверів) | Дешевше, більш стійко, простіше зростати |
Щодо масштабування: додавання додаткових серверів (масштабування ширше) переважає оновлення однієї потужної машини (масштабування вгору) для майже кожного стандартного робочого навантаження agentic. Агенти в основному незалежні один від одного, тому розподіл їх між машинами покращує доступність і дешевше утримує витрати, коли флот зростає.
Що це означає для людей, які керують цими системами?
Спостерігайте за затримкою завдання P95, час, до якого закінчиться 95 відсотків завдань, а не за середнім використанням CPU. Середнє використання виглядає добре прямо до моменту, коли накопичуються черги і користувачі починають чекати. Затримка P95 виявляє цю проблему раніше.
Організації, які бачать реальні результати, не запускають експерименти. Вони обертають агентів навколо робочих процесів, які вже мають чіткі правила: перевірка коду, регресійне тестування (автоматизовані перевірки того, що нове програмне забезпечення не зламало старі функції), сортування квитків та аудити безпеки. Це місця, де агенти дають вимірювальні приросту продуктивності без необхідності для організації переосмислити все одразу.
Поширені питання
Чи мені потрібне спеціальне обладнання для запуску AI агентів?
Не обов'язково. Висновки Intel свідчать про те, що додавання додаткових стандартних серверів (масштабування ширше) працює краще, ніж купівля однієї дуже потужної машини для більшості робочих навантажень агентів. Спеціалізоване обладнання варто розглядати лише тоді, коли агенти потребують важких паралельних обчислень або спільного використання стану так, як це робить розділення їх між серверами непрактичним.
Чим AI агент відрізняється від чатбота?
Чатбот відповідає на питання. Агент планує послідовність кроків, використовує інструменти, такі як бази даних або компілятори коду, перевіряє, чи сработав кожен крок, і повторює спробу, якщо цього не сталося. Цією додатковою складністю пояснюється те, чому правильне запущення агентів вимагає думки про всю систему, а не лише про модель AI у її центрі.
Чи ці висновки рецензовані пірами?
Ні. Ця робота походить від власних внутрішніх експериментів Intel і була опублікована як спонсоруваний продавцем контент. Базовий фреймворк Terminal-Bench має відкритий код і доступний для незалежного огляду, але конкретні висновки не були незалежно відтворені або опубліковані в рецензованому журналі.



