Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 7 августа 2026 г.

Новости

TutorMoments: LLM-репетиторы срываются на перехвал

Языковая модель на развилке в уроке математики: дать подсказку ученику или отпустить его разбираться самому.

Обученная «быть полезной» модель в роли репетитора чаще делает шаг за ученика, чем отпускает к самостоятельному разбору — тот же перекос, что у агента, который тянет весь рефакторинг вместо наводящего вопроса. Allen AI выложила TutorMoments: replay-бенчмарк на 462 уроках математики для учеников 2–7 классов в США, где на размеченных развилках видно, помочь вовремя или перехвалить.

Как устроен replay

  • 27 учителей разметили более 1500 ключевых моментов в транскриптах реальной программы репетиторства.
  • На каждой развилке транскрипт стопорится: LLM — репетитор на пять ходов, вторую модель играет ученик.
  • Три оси оценки: уместная опора (scaffolding), уместный push for rigor и отсутствие перехвала.
  • Эталон — большинство меток учителей; отдельный LM-классификатор сверяет ход модели с ним.

Результаты прогонов

Семь LLM прогнали с нейтральным промптом «репетируй хорошо» и с явным описанием trade-off между опорой, перехвалом и rigor. Evaluation-aware промпт поднял все модели, но разброс между ними остался — при «голом» промпте перехвал доминирует, с подсказкой чаще просят объяснить ответ, но стратегий меньше, чем у людей.

Для ориентира: люди на тех же точках — 0,458 по опоре, 0,182 по rigor, 0,496 по избеганию перехвала (738 моментов звали к scaffolding, 260 — к rigor). Сравнение несимметричное: аннотаторы отмечали места, где репетиторство могло пойти лучше, а replay идёт с «оракулом»-учеником, без замера реального обучения. Датасет TutorMoments-Preview и код открыты на Hugging Face и GitHub.

Источник: TutorMoments: Do AI tutors know when to help and when to hold back?.