ШІ-репетитори занадто допомагають. Новий тест показує, що вони не знають, коли потрібно відступити
Дослідники Інституту штучного інтелекту Allen розробили бенчмарк на основі реальних транскриптів занять у класі, щоб дізнатися, чи можуть ШІ-репетитори приймати найважче рішення в педагогіці: коли допомагати учневі, а коли дозволити йому самостійно боротися з проблемою.

Ключові моменти
- Allen Institute for AI представив TutorMoments — бенчмарк на основі 462 реальних транскриптів індивідуальних занять з математики, щоб протестувати, наскільки добре ШІ-репетитори визначають, коли допомагати, а коли стримуватись.
- Набір даних включає понад 1500 моментів прийняття рішень, відзначених 27 досвідченими вчителями математики з США (2–7 класи).
- Протестовано сім великих мовних моделей — технологію, що лежить в основі чатботів, як-от ChatGPT і Claude; всі вони за замовчуванням надмірно допомагали учням під час роботи без конкретних інструкцій.
- Більш детальні підказки покращували результати моделі, але жодна з них послідовно не відповідала судженням людських репетиторів у тих же моментах.
- Бенчмарк, набір даних і код вільно доступні та опубліковані частково через репозиторій Hugging Face.
Хороший репетитор з математики, коли учень застряває, зазвичай ставить запитання, а не дає відповідь. «Що ти вже знаєш про цю задачу?» Ця пауза, цей невеликий опір, спрямований назад на учня, мають навмисний характер. Це те, як знання закріплюється.
Чатботи ШІ працюють навпаки. Їхня вся мета — бути корисними, що в контексті репетиторства часто означає пояснити концепцію, викласти кроки та провести учня прямо до відповіді. Це обходить умовне мислення, яке дослідники вважають центральним для справжнього розуміння.
Команда Інституту штучного інтелекту Allen хотіла дізнатися, наскільки серйозна насправді проблема, і чи можна її вирішити.
Як насправді працює TutorMoments?
Дослідники розробили бенчмарк TutorMoments на основі реальних занять з репетиторством, а не вигаданих сценаріїв. Вони зібрали 462 транскрипти з програми репетиторства США, яка обслуговує переважно малозабезпечені школи, видалили всю інформацію, що ідентифікує, і передали транскрипти 27 досвідченим вчителям математики.
Вчителі прочитали кожний транскрипт і відзначили моменти, коли репетитор стоював перед справжнім вибором: спростити задачу, щоб в неї легше було входити, чи спонукати учня думати глибше. Ці відзначені моменти стали тестом.
У кожній відзначеній точці велика мовна модель займає місце репетитора на п'ять обмінів, а друга мовна модель грає роль учня. Система оцінювання потім перевіряє, чи ШІ-репетитор прийняв правильне рішення для цього моменту, виходячи з того, що вчителі сказали про те, що насправді потрібно учню.
Вимірюються три речі: чи модель надала відповідну підтримку, коли вона була потрібна, чи спонукала до глибшого мислення, коли учень був готовий, і чи уникла надання більше допомоги, ніж потрібно для цього моменту.
Що насправді робили ШІ-репетитори?
Кожна з протестованих моделей за замовчуванням надмірно допомагала. Маючи просту інструкцію «добре репетирувати», всі сім моделей були схильні пояснювати та керувати, а не спонукати учнів думати.
Коли дослідники переписали підказку, щоб явно викласти компроміс, результати поліпшилися по всій дошці. Але жодна модель надійно не приймала правильне рішення так, як це робить досвідчений учитель.
Результати нижче показують оцінки від 0 до 1, де 1 означає, що модель прийняла правильне рішення в кожному релевантному моменті.
| Тип підказки | Відповідна підтримка | Відповідна складність | Уникає надмірної підтримки |
|---|---|---|---|
| Людські репетитори (еталон) | 0,458 | 0,182 | 0,496 |
| Звичайна підказка (середнє ШІ) | Нижче людського рівня | Близько нуля | Низько |
| Підказка з урахуванням оцінювання (найкраще ШІ) | Вище людського рівня | Вище | Вище |
Одне важливе застереження: оцінки людських репетиторів виглядають низькими, оскільки набір даних був навмисно побудований навколо упущених можливостей, моментів, коли вчителі відчували, що можна було б зробити щось краще. Тому людські цифри — це не картина ідеального навчання.
Що це означає для учнів, які використовують інструменти ШІ-репетиторства?
Якщо ваша дитина або учень користується додатком ШІ-репетиторства, додаток, ймовірно, передумовлює занадто багато розумової роботи за них. У момент це здається корисним. З часом це може бути неплідно.
Дослідники не кажуть, що ШІ-репетитори марні. Вони кажуть, що область потребує кращих способів вимірювання та навчання цієї конкретної навички. Модель, яка ніколи не видає відповідь, — це не обов'язково хороший репетитор; важливо те, чи читає вона учня правильно в кожний окремий момент.
Повний набір даних, код бенчмарку та технічний звіт загальнодоступні, як і набір даних на Hugging Face, тому інші дослідники та компанії, які розробляють інструменти ШІ-репетиторства, можуть тестувати свої моделі на основі одних і тих же реальних точок прийняття рішень.
На що звернути увагу, якщо ви користуєтесь інструментом ШІ-репетиторства: помітьте, чи інструмент ставить вам запитання чи просто відповідає на них. Інструмент, який завжди пояснює, — це не репетиторство. Це виконання домашнього завдання.



