Пять вещей, которые должны знать лидеры предприятий перед развёртыванием AI-агентов
Intel провёл тысячи экспериментов с рабочими нагрузками на агентные AI-системы и обнаружил, что большинство организаций измеряют неправильные показатели. Вот что действительно имеет значение при переходе за пределы чат-ботов.

Ключевые моменты
- Intel провёл тысячи экспериментов с рабочими нагрузками на агентные AI-системы, чтобы измерить производительность AI-агентов в полных корпоративных системах, а не только ответные характеристики AI-моделей.
- Большинство существующих инструментов бенчмаркинга измеряют только то, насколько хорошо работает базовая AI-модель, полностью упуская общую картину системы.
- Правильный показатель мощности — это агенты на виртуальный процессор (vCPU), вычислительную единицу, представляющую один срез вычислительной мощности сервера, а не общее количество агентов.
- Мониторинг среднего использования CPU может скрывать серьёзные замедления; задержка задачи, время, необходимое задаче для завершения, — лучший показатель проблемы.
- Распределение рабочих нагрузок на несколько серверов, а не обновление одной мощной машины, обычно является более дешёвым и надёжным подходом для запуска агентов в масштабе.
AI-агенты — это программное обеспечение, которое может самостоятельно планировать и выполнять многоэтапные задачи: назначать встречи, сортировать заявки поддержки, запускать тесты кода без участия человека на каждом шаге. Предприятия делают ставку на них. Однако новые выводы Intel предполагают, что большинство организаций неправильно подходят к проблеме.
Intel расширил Terminal-Bench, платформу открытого кода, используемую для оценки поведения AI-агентов, добавив инструменты профилирования и телеметрию (данные о том, как работает программное обеспечение в действительности). Задачи варьировались от запросов к базам данных до транскодирования видео. Результаты были опубликованы как практическое руководство для команд корпоративных технологий и изначально представлены MIT Technology Review как спонсируемый контент от Intel.
Это паттерн, который описала наша более ранняя статья "Ваш AI-чат-бот не сломан. Ваш конвейер данных есть." в июле: команды предприятий постоянно винят модель, когда настоящая проблема находится в другом месте в системе.
Что компании делают неправильно?
Большинство команд измеряют саму AI-модель: точность и скорость ответа. Это упускает большинство того, что делает агента медленным или ненадёжным на практике.
Агент делает намного больше, чем просто обращается к языковой модели. Он считывает данные, вызывает инструменты, проверяет результаты и повторяет попытку, когда что-то ломается. Каждый шаг требует времени и вычислительной мощности. Intel обнаружил, что производительность модели сама по себе почти ничего не говорит о том, выдержит ли ваш парк агентов реальную бизнес-нагрузку.
Шесть показателей, которые рекомендует отслеживать Intel: уровень успешности задачи, стоимость за задачу, время на задачу, пропускная способность задач (количество задач, которые система выполняет за определённый период), плотность агентов (агенты на vCPU) и сквозная задержка.
Как команды должны планировать масштабирование?
Определяйте размер системы по плотности агентов, а не по количеству агентов. Десять агентов на 8-vCPU сервере работают почти идентично 20 агентам на 16-vCPU сервере, потому что плотность одинакова. Это единственное понимание позволяет архитекторам справедливо сравнивать разные размеры серверов.
Целевые показатели плотности также зависят от того, чем занимаются агенты. Агенты, работающие с сотрудниками, нуждаются в быстром времени отклика, поэтому вы держите плотность низкой. Фоновые пакетные работы, такие как автоматизированные IT-рабочие процессы или ночные запуски тестирования кода, могут работать с более высокой плотностью без какого-либо заметного незначительного отставания.
| Тип рабочей нагрузки | Рекомендуемая плотность | Почему |
|---|---|---|
| Интерактивный помощник / ассистент с пользовательским интерфейсом | Низкая плотность | Время отклика видно пользователям |
| Пакетные IT-рабочие процессы или тестирование | Высокая плотность | Незначительные задержки приемлемы |
| Интенсивные задачи параллельных вычислений | Масштабирование (более мощный одиночный сервер) | Требует сконцентрированной вычислительной мощности |
| Большинство других корпоративных рабочих нагрузок | Горизонтальное масштабирование (больше серверов) | Дешевле, более устойчиво, легче расширяется |
Добавление большего количества серверов (горизонтальное масштабирование) превосходит обновление одной машины (вертикальное масштабирование) почти для всех стандартных агентных рабочих нагрузок. Агенты в основном независимы друг от друга, поэтому их распределение по машинам улучшает доступность и снижает затраты по мере роста парка.
Что это означает для людей, управляющих этими системами?
Наблюдайте за 95-й процентилью задержки задачи (время, к которому завершены 95 процентов задач), а не за средним использованием CPU. Среднее использование выглядит нормально прямо до того момента, пока не начнут накапливаться очереди и пользователи не начнут ждать. Задержка P95 выявляет эту проблему раньше.
Организации, видящие реальные результаты, не проводят эксперименты. Они оборачивают агентов вокруг рабочих процессов, которые уже имеют чёткие правила: проверку кода, регрессионное тестирование (автоматизированные проверки того, что новое программное обеспечение не сломало старые функции), сортировку заявок и аудиты безопасности. Именно там агенты дают измеримые приросты производительности без необходимости переосмысливать всю организацию сразу.
Честная оценка этого отчёта: выводы Intel логичны и направлены в правильном направлении, а платформа Terminal-Bench имеет открытый исходный код, поэтому команды могут самостоятельно проверить его структуру. Однако конкретные цифры независимо не проверены, и предприятия должны рассматривать их как стартовую базу, а не окончательные эталоны.
Часто задаваемые вопросы
Нужно ли специальное оборудование для запуска AI-агентов?
Не обязательно. Выводы Intel предполагают, что добавление большего количества стандартных серверов работает лучше, чем покупка одной мощной машины для большинства агентных рабочих нагрузок. Специализированное оборудование стоит рассмотреть только тогда, когда агентам нужны интенсивные параллельные вычисления или когда они обмениваются состоянием таким образом, что разделение их на несколько серверов становится непрактичным.
Чем AI-агент отличается от чат-бота?
Чат-бот отвечает на вопросы. Агент планирует последовательность шагов, использует инструменты, такие как базы данных или компиляторы кода, проверяет, сработал ли каждый шаг, и повторяет попытку, если нет. Эта дополнительная сложность объясняет, почему эффективный запуск агентов требует думать о всей системе, а не только об AI-модели в её центре.
Являются ли эти выводы рецензируемыми исследованиями?
Нет. Эта работа основана на собственных внутренних экспериментах Intel и была опубликована как спонсируемый контент производителя. Базовая платформа Terminal-Bench имеет открытый исходный код и доступна для независимого анализа, но конкретные выводы не были независимо проверены или опубликованы в рецензируемом журнале.



