Чому ШІ застрягає на половині складного завдання (та новий спосіб від Apple)

Дослідники виявили, що розбиття складної проблеми на занадто багато крихітних кроків може захопити ШІ в помилці, від якої він не може втекти. Новий метод LEAD додає коротку перевірку на перспективу, що допомагає йому відновитися.

AI2Day Newsdesk3 min read
Photoreal editorial shot of a dimly lit network operations center at night, rows of monitors displaying blurred dashboards and green terminal text, an empty rol
Share

Ключові моменти

  • Apple ML Research опублікувала дослідження, яке показує, що сучасні великі мовні моделі не можуть надійно завершити довгі багатокрокові завдання міркування, навіть коли їм дано чіткий план дій.
  • Збій не випадковий: невелика кількість «складних» кроків призводить до майже всіх помилок, і як тільки ШІ звалиться на один з них, він рідко відновлюється.
  • Розбиття завдання на занадто багато крихітних кроків погіршує проблему, оскільки немає місця для виправлення помилки перед тим, як наступний крок її закріпить.
  • Нова методика під назвою LEAD (Lookahead-Enhanced Atomic Decomposition) додає коротку перевірку наперед після кожного кроку, щоб виловити помилки перед тим, як вони стануть постійними.
  • Дослідження тестували на контрольованих завданнях-головоломках, тому результати в реальному світі потребуватимуть подальшого вивчення.

Уявіть, що ви просите дуже здібного асистента зібрати меблі конструктора, дотримуючись 40-крокової інструкції. Він розумний, мотивований і має повний план. Але є три кроки, які справді складні. Пропустити один з них, і кожен наступний крок буде спиратися на перекошену раму. На кроці 35 все вже непоправимо.

Це, грубо кажучи, проблема, яку Apple ML Research розглядає під мікроскопом.

Що насправді йде не так?

Великі мовні моделі, системи ШІ, які стоять за чатботами на кшталт ChatGPT та Claude, мають проблеми з завершенням довгих ланцюжків міркування без помилок. Надання їм високовисокої стратегії допомагає, але не вирішує проблему повністю.

Команда Apple знайшла щось конкретне. Помилки не поширюються рівномірно по всьому завданню. Кілька кроків відповідають за майже всі збої. Пропустити один з цих «складних» кроків, і ШІ буде без шансу повернутися.

Інстинкт дослідників полягав у тому, щоб розділити завдання на все більш малі частини, щоб ШІ повинен був думати лише про одну крихітну річ одночасно. Мається на увазі. Але дослідження показує, що заходити занадто далеко створює те, що дослідники називають «вузьким місцем без відновлення»: кожна частина настільки мала і настільки жорстко пов'язана з наступною, що одна помилка миттєво закріплюється в ланцюзі.

Що насправді робить LEAD?

Виправлення називається LEAD, скорочення від Lookahead-Enhanced Atomic Decomposition. Він зберігає підхід з малими кроками, але додає коротку перевірку наперед після кожного кроку.

Перед тим, як затвердити хід, система зазирає на кілька кроків наперед, щоб запитати: чи цей шлях все ще веде куди-небудь розумно? Якщо ні, він може налаштуватися до того, як помилка стане постійною. Думайте про це як ШІ коротко сканує наступні кілька клітинок на дошці перед тим, як поставити свою фігуру.

Дослідники тестували LEAD на алгоритмічних головоломках, контрольованих завданнях з чіткими правильними та неправильними відповідями, що полегшило точне виміру того, де все пішло не так.

Чи повинен хтось діяти на це прямо зараз?

Ще не. Це науковий папір, а не оновлення продукту. Тести використовували структуровані головоломки, і продуктивність на головоломках не завжди чисто переводиться в брудні, відкриті завдання, які реальні користувачі ставлять ШІ-асистентам.

Це говорить нам про те, що наступна хвиля поліпшень ШІ може походити не з того, щоб робити моделі більшими, а з того, щоб вони краще перевіряли свою роботу під час завдання. Це важливо для тих, хто просить ШІ розробити щось з багатьма кроками: написання довгого звіту, налагодження коду або планування проекту.

Стежте за тим, чи з'являється ця методика (або щось подібне) у майбутніх оновленнях моделей від великих лабораторій.

Часті запитання

Чи це впливає на інструменти ШІ, які я використовую сьогодні?

Не безпосередньо. LEAD — це дослідницька методика, а не вже розповсюджена функція в жодному споживчому продукті. Поточні інструменти все ще страждають від вузького місця, яке описує стаття, особливо для довгих або складних завдань.

Чому тестувати на головоломках замість реальних завдань?

Головоломки мають певні правильні відповіді, що дозволяє дослідникам точно виміряти, де і як часто ШІ дає збій. Завдання в реальному світі важче точно оцінити, тому головоломки є корисним першим полігоном для випробування.

© 2026 AI2Day