Почему AI застревает на половине сложной задачи (и новое решение от Apple)
Исследователи обнаружили, что разбиение сложной проблемы на слишком много мелких шагов может поймать AI в ошибку, из которой он не может выбраться. Новый метод LEAD добавляет короткую проверку с опережением, которая помогает ему восстановиться.

Ключевые моменты
- Apple ML Research опубликовала исследование, показывающее, что современные большие языковые модели не могут надежно завершить длинные многошаговые задачи рассуждения, даже если им дан четкий план.
- Сбой не случайный: небольшое число "сложных" шагов вызывает почти все ошибки, и как только AI оступается на одном из них, он редко восстанавливается.
- Разбиение задачи на слишком много мелких шагов усугубляет проблему, поскольку нет возможности исправить ошибку до того, как следующий шаг зафиксирует её.
- Новая техника LEAD (Lookahead-Enhanced Atomic Decomposition) добавляет короткую проверку прогноза после каждого шага, чтобы поймать ошибки до того, как они станут постоянными.
- Исследование было протестировано на контролируемых головоломках, поэтому результаты в реальном мире потребуют дальнейшего изучения.
Представьте, что вы просите очень способного помощника собрать мебель из набора по инструкции из 40 шагов. Он умный, мотивированный и у него есть весь план. Но есть три шага, которые действительно сложные. Пропустить один из них — и каждый последующий шаг строится на искривленном каркасе. К шагу 35 всё становится невозможно спасти.
Это, грубо говоря, проблема, которую Apple ML Research рассмотрела под микроскопом.
Что именно идет не так?
Большие языковые модели, системы AI, лежащие в основе чат-ботов типа ChatGPT и Claude, с трудом завершают длинные цепочки рассуждений без ошибок. Предоставление им высокоуровневой стратегии помогает, но не полностью решает проблему.
Команда Apple обнаружила что-то специфическое. Ошибки распределяются неравномерно по задаче. Несколько шагов отвечают за почти все сбои. Пропустить один из этих "сложных" шагов — и AI не может повернуть назад.
Инстинкт исследователей состоял в том, чтобы разбивать задачи на всё более мелкие части, чтобы AI должен был думать только об одной крошечной вещи одновременно. Справедливо. Но исследование показывает, что если зайти слишком далеко, возникает то, что исследователи называют "узким местом без восстановления": каждая часть настолько мала и так жестко связана со следующей, что одна ошибка сразу же закрепляется в цепи.
Что именно делает LEAD?
Решение называется LEAD, сокращение от Lookahead-Enhanced Atomic Decomposition. Оно сохраняет подход с небольшими шагами, но добавляет короткую проверку с опережением после каждого шага.
Перед тем как принять ход, система кратко проверяет несколько шагов вперед, чтобы спросить: приведет ли этот путь куда-то имеющему смысл? Если нет, система может подстроиться до того, как ошибка станет постоянной. Думайте об этом как об AI, которая кратко сканирует несколько клеток впереди перед тем, как поставить свою фигуру.
Исследователи протестировали LEAD на алгоритмических головоломках, контролируемых задачах с четкими правильными и неправильными ответами, что облегчило точное измерение того, где всё развалилось.
Должен ли кто-то действовать сейчас?
Пока нет. Это исследовательская статья, а не обновление продукта. Тесты использовали структурированные головоломки, и производительность на головоломках не всегда переводится ясно на беспорядочные, открытые задачи, которые реальные пользователи ставят перед AI-помощниками.
Что это нам говорит, так это то, что следующая волна улучшений AI может исходить не из увеличения размера моделей, а из их лучшей способности проверять собственную работу во время выполнения задачи. Это важно для всех, кто просит AI справиться с чем-то, имеющим много шагов: написание длинного отчета, отладка кода или планирование проекта.
Следите за тем, появится ли эта техника (или что-то подобное) в будущих обновлениях моделей от крупных лабораторий.
Часто задаваемые вопросы
Влияет ли это на используемые мной сегодня инструменты AI?
Не напрямую. LEAD — это исследовательская техника, еще не выпущенная функция ни в каком потребительском продукте. Текущие инструменты по-прежнему страдают от узкого места, описанного в статье, особенно на длинных или сложных задачах.
Почему тестировать на головоломках вместо реальных задач?
Головоломки имеют определенные правильные ответы, что позволяет исследователям точно измерить, где и как часто AI ошибается. Задачи реального мира сложнее оценивать точно, поэтому головоломки — полезная первая база для проверки.



