ИИ-репетиторы помогают слишком охотно. Новый тест показывает, что они не умеют вовремя отступить

Исследователи из Allen Institute for AI создали бенчмарк на основе реальных записей уроков, чтобы проверить, могут ли ИИ-репетиторы принять самое сложное решение в обучении: помочь ученику или дать ему самостоятельно справиться с задачей.

AI2Day Newsdesk4 min read
Photoreal editorial shot of a modern laptop on a bright desk, screen glowing with an abstract video editing timeline and a soft blurred portrait thumbnail sugge
Share

Ключевые моменты

  • Allen Institute for AI выпустил TutorMoments — бенчмарк на основе 462 реальных записей индивидуальных уроков математики, чтобы проверить, насколько хорошо ИИ-репетиторы оценивают, когда помочь, а когда сдержаться.
  • Набор данных содержит более 1500 точек решения, выделенных 27 опытными учителями математики из США, работающими в классах со 2 по 7.
  • Протестировано семь больших языковых моделей — технология, лежащая в основе чатботов вроде ChatGPT и Claude. Все они по умолчанию оказывали избыточную помощь учащимся без конкретных инструкций.
  • Более детальная подсказка улучшила результаты моделей, но ни одна из них не проявила такое же суждение, как человеческие репетиторы в тех же ситуациях.
  • Бенчмарк, набор данных и код доступны свободно и опубликованы в репозитории данных Hugging Face.

Хороший репетитор по математике, когда ученик затрудняется с ответом, обычно задаёт вопрос, а не отвечает на него. «Что ты уже знаешь об этой задаче?» Эта пауза, этот небольшой толчок обратно к ученику — всё это сделано намеренно. Именно так знания закрепляются.

ИИ-чатботы работают наоборот. Их главная цель — быть полезными, что в контексте обучения обычно означает объяснение концепции, изложение шагов и прямое направление ученика к ответу. Это подрывает кропотливое мышление, которое, по словам исследователей, является центральным для глубокого понимания.

Команда Allen Institute for AI хотела узнать, насколько серьёзна на самом деле эта проблема и можно ли её решить.

Как работает TutorMoments?

Исследователи создали бенчмарк TutorMoments на основе реальных учебных сессий, а не выдуманных сценариев. Они собрали 462 транскрипта с программы репетиторства в США, обслуживающей в основном школы с низким доходом, удалили все идентифицирующие данные и передали транскрипты 27 опытным учителям математики.

Учителя прочитали каждый транскрипт и отметили моменты, где репетитор стоял перед выбором: облегчить задачу для входа в неё или подтолкнуть ученика к более глубокому размышлению. Эти отмеченные моменты стали основой теста.

В каждой отмеченной точке большая языковая модель берёт на себя ведение сессии на пять обменов, а вторая языковая модель играет роль ученика. Затем система оценивания проверяет, правильно ли ИИ-репетитор принял решение в этот момент, основываясь на том, что учителя сказали о том, что ученику действительно требовалось.

Измеряются три аспекта: предоставила ли модель надлежащую помощь при необходимости, подтолкнула ли учащегося к более глубокому мышлению, когда он был готов, и избегла ли она оказания большей помощи, чем требовал момент.

Что на самом деле делали ИИ-репетиторы?

Все протестированные модели склонялись к избыточной помощи. При простой инструкции «обучай хорошо» все семь моделей предпочитали объяснять и направлять, а не подталкивать учащихся к размышлению.

Когда исследователи переписали подсказку, чтобы явно описать компромисс, результаты улучшились по всем моделям. Но ни одна из них не принимала правильное решение так надёжно, как опытный учитель.

Результаты ниже показывают оценки от 0 до 1, где 1 означает, что модель принимала правильное решение в каждый релевантный момент.

Тип подсказки Надлежащая поддержка Надлежащая строгость Избегает чрезмерной поддержки
Репетиторы-люди (эталон) 0.458 0.182 0.496
Простая подсказка (среднее ИИ) Ниже, чем у людей Близко к нулю Низко
Оценочная подсказка (лучшее ИИ) Выше, чем у людей Выше Выше

Один важный момент: показатели человеческих репетиторов кажутся низкими, потому что набор данных был намеренно построен вокруг упущенных возможностей, моментов, когда учителя чувствовали, что могло быть сделано что-то лучшее. Поэтому цифры по людям не отражают картину идеального преподавания.

Что это означает для учащихся, использующих инструменты ИИ-репетиторства?

Если ваш ребёнок или ученик использует приложение ИИ-репетитора, приложение, вероятно, думает за него слишком много. В момент это кажется полезным. Со временем это может быть неправильно.

Исследователи не говорят, что ИИ-репетиторы бесполезны. Они говорят, что в области нужны лучшие способы измерения и обучения этому конкретному навыку. Модель, которая никогда не выдаёт ответ, — это не автоматически хороший репетитор; важно, правильно ли она разбирает учащегося в каждый отдельный момент.

Полный набор данных, код бенчмарка и технический отчёт доступны в открытом доступе, так же как и набор данных на Hugging Face, чтобы другие исследователи и компании, разрабатывающие инструменты ИИ-репетиторства, могли тестировать свои модели на тех же точках реальных решений.

На что обратить внимание, если вы используете инструмент ИИ-репетиторства: заметьте, задаёт ли он вам вопросы или просто на них отвечает. Инструмент, который всегда объясняет, — это не репетиторство. Это выполнение домашнего задания.

© 2026 AI2Day