Сократите счета за AI на 40% без изменения модели: вот как это удалось одной компании

Новое исследование от Writer показывает, что переделка программного слоя вокруг языковой модели, а не самой модели, снижает затраты почти на 40% и сокращает время выполнения задач вдвое.

AI2Day Newsdesk· 4 min read
A glowing neural network diagram rendered in deep blue and amber tones spreads across a dark server room background, with rows of blinking server racks visible
Share

Ключевые моменты

  • Исследовательская группа Writer снизила среднюю стоимость одной AI-задачи на 41%, с 21 цента до 12 центов, переработав слой оркестрации вокруг модели, а не саму модель.
  • Потребление токенов, объем текста, обработанного в каждой задаче, упал на 38%, с 14 200 токенов до 8 800 токенов на задачу.
  • Процент успешно выполненных задач остался на прежнем уровне или немного улучшился, увеличившись с 78% до 81%, а медианное время выполнения задачи сократилось на 44%, с 48 секунд до 27 секунд.
  • Прирост эффективности надежно сохранялся только на двух самых мощных тестировавшихся моделях: собственной Palmyra X6 компании Writer и Claude Sonnet 4.6 компании Anthropic.
  • Исследователи опубликовали свои выводы в работе, которую любая инженерная команда может применить уже сегодня, поскольку она не требует изменений базовой AI-модели.

AI — это дорого. Любая компания, которая вышла за рамки небольшого прототипа и начала использовать AI-инструменты в реальном масштабе, ощущает это в счетах. Новая исследовательская работа от Writer, корпоративной AI-софтверной компании, теперь приводит точные цифры того, почему расходы растут в геометрической прогрессии, и показывает практическое решение, которое не требует замены AI-модели или переобучения.

Вкратце: проблема не в модели. Это проблема в инфраструктуре вокруг неё.

Что такое «AI-оснащение» и почему это важно?

AI-оснащение, иногда называемое слоем оркестрации, — это программное обеспечение, которое находится между вашим приложением и самой AI-моделью. Думайте о нём как о режиссёре сцены. Оно решает, какие инструкции отправить модели, какие документы ей предоставить, как обрабатывать ошибки и когда привлечь специализированные инструменты. Большинство команд разработки создают этот слой быстро и рассматривают его как вспомогательный код. Исследователи Writer утверждают, что это сейчас самая дорогостоящая ошибка в AI-инженерии.

В исследовании тестировались шесть различных AI-моделей, включая Claude Sonnet 4.6 от Anthropic, Gemini Flash 3.5 от Google и собственную Palmyra X6 от Writer, на 22 стандартизированных бизнес-задачах. Они оставили модели и задачи идентичными, затем сравнили стандартное оснащение с тщательно оптимизированным. Результаты удивили даже самих исследователей.

Затраты упали на 41%. Время выполнения задачи сократилось на 44%. Качество не упало вообще.

Куда же исчезали деньги раньше? У источника этого расточительства есть название в индустрии: «tokenmaxxing» (максимизация токенов). Токен — это небольшой фрагмент текста, примерно три четверти слова, который читает и генерирует AI-модель. Провайдеры берут плату за токены. Максимизация токенов — это привычка запихивать огромное количество текста в каждый AI-запрос в надежде, что модель разберётся, вместо того чтобы тщательно спроектировать запрос.

CTO Writer Васим АльШих сказал VentureBeat честно: «Ваш счет — это количество токенов на задачу, умноженное на цену за токен, а большинство команд смотрит только на второе число».

Снижение цен от AI-провайдеров кажется облегчением. Но если ваша система сжигает в три раза больше токенов, чем необходимо, то даже более дешёвые токены всё равно означают раздутый счет.

Оптимизированное оснащение решает эту проблему четырьмя способами: кешированием частей подсказки, которые никогда не меняются, чтобы вы не переплачивали за один и тот же текст при каждом обращении; сжатием истории разговора, чтобы старый контекст не накапливался; отправкой задач поиска малым специализированным подагентам вместо того, чтобы забивать сырые документы в основной разговор; и исключением бесконтрольных циклов повторных попыток, которые увеличивают количество токенов в геометрической прогрессии, когда модель столкнётся с ошибкой.

Стоит отметить одно предостережение. Подход с подагентами, при котором вы делегируете задачи меньшим специализированным моделям, работал надежно только на двух самых мощных тестировавшихся моделях. Более лёгкие модели типа Gemini Flash 3.5 показали результаты ниже приемлемого порога надежности при делегировании задач. Если ваша команда работает с меньшей, более дешёвой моделью, некоторые из этих выигрышей будут сложнее получить.

Но более широкий вывод верен независимо от того, какую модель вы используете. Структурируйте ваши подсказки так, чтобы статические части шли первыми, а динамические — последними. Одно это изменение заставляет кеширование подсказок действительно работать и спасает вас от двойной оплаты одних и тех же инструкций.

Один честный вывод: прежде чем потратить ещё доллар на более мощную AI-модель, проаудируйте, сколько токенов сжигает ваша текущая система на одну задачу. Это число, а не цена за токен, — вот где скрываются ваши реальные AI-затраты.

© 2026 AI2Day