Новости

Умеют ли нейросети вовремя промолчать: TutorMoments проверяет педагогическое чутьё ИИ-репетиторов

Институт Ai2 представил TutorMoments — фреймворк, который проверяет, понимают ли языковые модели, когда школьнику нужна подсказка, а когда лучше отступить и дать ему додуматься самому. Первые результаты показывают: ИИ-репетиторы слишком услужливы.

Институт искусственного интеллекта Аллена (Ai2) представил предварительную версию TutorMoments — системы оценки, которая измеряет один из самых тонких навыков хорошего педагога: умение чувствовать, когда ученику нужно помочь, а когда — сдержаться и позволить ему поработать самостоятельно. Первые результаты показали, что языковые модели, натренированные быть «полезными ассистентами», склонны чрезмерно опекать школьников и почти не подталкивают их к более глубоким рассуждениям.

Почему услужливый ассистент — не всегда хороший учитель

Попросите хорошего репетитора по математике о помощи — и в ответ, скорее всего, услышите вопрос: «А что ты уже понял из условия задачи?» Это не уклончивость. Важная часть сильного преподавания — диагностировать, что ученик знает прямо сейчас, и дать именно ту поддержку, которая нужна в конкретный момент. Если немедленно выдать подсказку, школьник лишится интеллектуальной работы, которая и даёт настоящее обучение. Иногда поддержка действительно необходима, но бывает, что эффективнее попросить ученика объяснить уже найденный правильный ответ — так понимание закрепляется глубже.

Языковые модели устроены иначе: их обучают быть полезными, а полезный ассистент стремится сделать сложную часть за вас — объяснить концепцию, разложить решение по шагам и подвести к ответу. В репетиторской сессии такое поведение обрывает то, что исследователи образования называют «продуктивной борьбой» — напряжённое, порой вызывающее фрустрацию решение задачи, которое наука об обучении давно связывает с более прочным пониманием материала.

Большинство существующих бенчмарков для моделей-тьюторов этой дилеммы не замечают. Они обычно поощряют одно фиксированное поведение — например, никогда не выдавать готовый ответ или всегда предлагать подсказку, — не спрашивая, было ли это правильным ходом для того уровня понимания, на котором реально находился ученик. Но хорошее репетиторство — не единая стратегия, а каждый раз новое решение: что нужно этому конкретному школьнику, прямо сейчас, в этой конкретной задаче?

Как устроен TutorMoments: реальные транскрипты и точки выбора

В отличие от синтетических тестов, TutorMoments построен на реальных данных. Публикуемый датасет TutorMoments-Preview включает 462 обезличенных текстовых транскрипта настоящих индивидуальных занятий по математике с американскими школьниками со 2 по 7 класс. В материалах размечено более 1500 ключевых моментов, а всего 27 опытных учителей математики из США оставили несколько тысяч аннотаций в свободной форме.

Транскрипты взяты из программы интенсивного репетиторства, ученики которой в основном посещают школы Title I — американский аналог школ, получающих федеральную поддержку из-за высокой доли детей из малообеспеченных семей. Данные переданы в рамках исследовательского соглашения, с которым согласились родители и опекуны, а все идентифицирующие сведения удалены дважды: сначала самим провайдером программы, затем дополнительным конвейером, специально учитывающим специфику математических текстов.

Учителей-аннотаторов просили читать транскрипты и отмечать ключевые моменты обучения: что происходило, что сделал репетитор и как это отразилось на ученике. Каждый такой момент — точка решения, где педагогу приходилось выбирать между «скаффолдингом» (упрощением задачи, чтобы в неё было проще войти) и требованием строгости — подталкиванием школьника к более трудной самостоятельной работе.

Механика оценки выглядит так: транскрипт останавливается на одном из ключевых моментов, и управление сессией передаётся языковой модели. Она пять ходов ведёт занятие в роли репетитора с симулированным учеником, которого играет другая языковая модель. Каждое такое продолжение авторы называют «реплеем». Затем автоматический конвейер оценки на базе языковой модели проверяет реплей по трём критериям: дал ли ИИ-тьютор поддержку, когда ученик в ней нуждался; подтолкнул ли к строгости, когда ученик был готов к более сложной работе; и не упростил ли задачу сильнее, чем требовал момент.

Оценка опирается на эталон, заданный учителями: для каждого ключевого момента известно, чего он требовал — поддержки или строгости. Каждый момент размечали несколько педагогов, а при расхождениях бралась метка большинства: если два учителя из трёх считали, что нужно требовать строгости, эталонным ответом становится именно она. Отдельный классификатор на языковой модели, проверенный на учительских аннотациях, определяет, совпал ли реальный ход ИИ-тьютора с тем, что требовалось: «уместным» считается ход, где классифицированное действие модели совпадает с оценкой педагогов.

Что показали тесты семи языковых моделей

Через TutorMoments прогнали семь языковых моделей с двумя вариантами промптов. Первый — «пустой»: модели просто говорят использовать свои представления о хорошем репетиторстве и отвечать ученику, без каких-либо подсказок о том, что именно оценивается. Второй — «осведомлённый об оценке»: в нём прямо прописана дилемма между скаффолдингом, чрезмерным упрощением и требованием строгости. Ключевые моменты для теста поделили поровну между ситуациями, где правильной была поддержка, и теми, где требовалась строгость.

Каждая оценка — доля от 0 до 1, показывающая, в какой части релевантных моментов модель поступила уместно. Например, 0,50 по уместной строгости означает, что модель подталкивала ученика к более глубокой работе в половине ситуаций, где это было нужно.

Самый отчётливый вывод из таблицы результатов — решающая роль промпта: каждая модель набирает больше баллов с осведомлённым промптом, чем с пустым. Это значит, что стандартного поведения «полезного ассистента» само по себе недостаточно, чтобы хорошо учить. При этом явное описание дилеммы помогает лишь отчасти: оценки растут у всех, но модели по-разному трактуют расширенную инструкцию, и даже у лучших остаётся большой запас для улучшения. Без подсказки модели в основном чрезмерно помогают — дают слишком много поддержки и редко провоцируют ученика на более глубокие размышления.

Исследователи также разобрали, какие именно приёмы используют ИИ-тьюторы в разных сценариях. Промптинг действительно заставляет модели чаще требовать строгости, но арсенал у них беднее человеческого: чаще всего они просто просят ученика объяснить свой ответ. Живые репетиторы действуют разнообразнее и гораздо охотнее делают шаг назад, позволяя школьнику работать самостоятельно.

Источник: HF