Пять вещей, которые должны знать лидеры предприятий перед развёртыванием AI-агентов
Intel провел тысячи экспериментов с рабочими нагрузками агентивного ИИ и обнаружил, что большинство организаций измеряют неправильные показатели. Вот что действительно имеет значение, когда вы выходите за пределы чат-ботов.

Ключевые моменты
- Intel провел тысячи экспериментов с рабочими нагрузками агентивного ИИ, чтобы измерить производительность AI-агентов на полных корпоративных системах, а не только ответы AI-моделей.
- Большинство существующих инструментов для бенчмаркинга измеряют только производительность основной AI-модели, полностью упуская общую картину системы.
- Правильным показателем емкости является число агентов на виртуальный процессор (vCPU) — вычислительную единицу, представляющую один срез вычислительной мощности сервера, а не общее количество агентов.
- Мониторинг среднего использования ЦП (насколько интенсивно работает процессор компьютера в среднем) может скрывать серьезные замедления; задержка задачи, то есть время, которое на самом деле требуется для выполнения задачи, — это лучший индикатор проблемы.
- Распределение рабочих нагрузок между несколькими серверами, а не модернизация одного мощного машины, обычно является более дешевым и надежным подходом для запуска агентов в масштабе.
AI-агенты — это программное обеспечение, которое может самостоятельно планировать и выполнять многошаговые задачи: записывать встречи, сортировать заявки в поддержку, запускать проверки кода — без необходимости вручную нажимать на каждый шаг. Предприятия активно делают ставку на них. Но новые выводы Intel предполагают, что большинство организаций подходят к проблеме неправильно.
Intel расширил Terminal-Bench, фреймворк с открытым исходным кодом, используемый для оценки поведения AI-агентов, добавив инструменты профилирования и подробную телеметрию (данные о том, как программное обеспечение работает на самом деле). Команда запустила агентов для задач, начиная от запросов к базам данных и заканчивая транскодированием видео, и зафиксировала результаты.
Результаты были опубликованы в виде практического руководства для технических команд предприятий и были изначально представлены в MIT Technology Review как спонсируемый контент от Intel.
Что делают неправильно компании?
Большинство команд измеряют саму AI-модель: насколько она точна, как быстро она отвечает? Это упускает большую часть того, что делает агента медленным или ненадежным в реальном мире.
Агент делает гораздо больше, чем разговаривает с языковой моделью. Он считывает данные, вызывает внешние инструменты, проверяет результаты и повторяет попытки, когда что-то ломается. Каждый из этих шагов требует времени и вычислительных ресурсов. Intel обнаружил, что сосредоточение внимания только на производительности модели почти ничего не говорит о том, выдержит ли ваш парк агентов реальную деловую нагрузку.
Шесть показателей, которые рекомендует отслеживать Intel: коэффициент успеха задачи, стоимость задачи, время задачи, пропускная способность задачи (количество задач, выполняемых системой за период), плотность агентов (агенты на vCPU) и сквозная задержка.
Как командам планировать масштабирование?
Масштабируйте систему по плотности агентов, а не по количеству агентов. Десять агентов, работающих на 8-vCPU сервере, ведут себя практически так же, как 20 агентов на 16-vCPU сервере, потому что плотность одинакова. Это единственное понимание позволяет архитекторам справедливо сравнивать серверы разных размеров.
Целевые значения плотности также зависят от того, что делают агенты. Агенты, которые напрямую взаимодействуют с сотрудниками, должны отвечать быстро, поэтому плотность остается низкой. Фоновые пакетные работы, такие как автоматизированные IT-процессы или ночные запуски тестирования кода, могут работать с более высокой плотностью без каких-либо видимых для кого-либо задержек.
| Тип рабочей нагрузки | Рекомендуемая плотность | Причина |
|---|---|---|
| Интерактивный помощник / ориентированный на пользователя ассистент | Низкая плотность | Время отклика видно для пользователей |
| Пакетные IT или тестовые процессы | Высокая плотность | Небольшие задержки приемлемы |
| Задачи интенсивных параллельных вычислений | Масштабирование вверх (более мощный отдельный сервер) | Требует сосредоточенной вычислительной мощности |
| Большинство других корпоративных рабочих нагрузок | Масштабирование наружу (больше серверов) | Дешевле, более устойчиво, легче расширяется |
При масштабировании: добавление большего количества серверов (горизонтальное масштабирование) превосходит модернизацию одной мощной машины (вертикальное масштабирование) почти для каждой стандартной рабочей нагрузки агентов. Агенты в значительной степени независимы друг от друга, поэтому их распределение между машинами повышает доступность и снижает затраты по мере расширения парка.
Что это значит для людей, управляющих этими системами?
Следите за P95 задержкой задачи, временем, к которому завершаются 95 процентов задач, а не за средним использованием ЦП. Среднее использование выглядит нормально прямо до момента, когда начинают накапливаться очереди и пользователи начинают ждать. P95 задержка перехватывает эту проблему раньше.
Организации, видящие реальные результаты, не запускают эксперименты. Они оборачивают агентов вокруг процессов, которые уже имеют четкие правила: проверка кода, регрессионное тестирование (автоматизированные проверки того, что новое программное обеспечение не сломало старые функции), сортировка заявок и аудиты безопасности. Это те места, где агенты дают измеримые приросты производительности без необходимости для организации полностью переосмыслять все сразу.
Часто задаваемые вопросы
Нужно ли мне специальное оборудование для запуска AI-агентов?
Не обязательно. Выводы Intel предполагают, что добавление большего количества стандартных серверов (горизонтальное масштабирование) работает лучше, чем покупка одной очень мощной машины для большинства рабочих нагрузок агентов. Специальное оборудование стоит рассмотреть только тогда, когда агентам требуются интенсивные параллельные вычисления или они совместно используют состояние таким образом, что разделение их между серверами становится нецелесообразным.
Чем AI-агент отличается от чат-бота?
Чат-бот отвечает на вопросы. Агент планирует последовательность шагов, использует инструменты, такие как базы данных или компиляторы кода, проверяет, сработал ли каждый шаг, и повторяет попытку, если это не так. Эта дополнительная сложность объясняет, почему правильное запуск агентов требует думать обо всей системе, а не только об AI-модели в ее центре.
Является ли это исследование рецензируемым?
Нет. Эта работа происходит из собственных внутренних экспериментов Intel и была опубликована как спонсируемый контент поставщика. Фреймворк Terminal-Bench с открытым исходным кодом доступен для независимого рецензирования, но конкретные выводы не были независимо воспроизведены или опубликованы в рецензируемом журнале.



