i
Новости
Новости · 2026-09-20

Цифровые ученики с реалистичными ошибками помогают ИИ-репетиторам учиться быстрее

@neuronium_ai @neuronium_ai

Microsoft и Иллинойсский университет создали StudentSim — систему, которая строит по небольшому числу записей отдельную цифровую копию каждого ученика. Такие симулированные ученики воспроизводят характерные ошибки и реагируют на подсказки репетитора, позволяя быстро и дешевле проверять учебные стратегии. В тестах на шахматах, английском как иностранном и математике StudentSim превзошла GPT-5.4, если тот выступал в роли ученика. Обученный на StudentSim шахматный репетитор также получил более высокие оценки за точность, качество объяснений и адаптацию к ученику.

Обложка: Цифровые ученики с реалистичными ошибками помогают ИИ-репетиторам учиться быстрее

ИИ-репетиторы лучше работают, когда подстраиваются под сильные и слабые стороны конкретного ученика. Но чтобы выяснить, какие подсказки подходят каждому человеку, нужны время и деньги: для этого приходится работать с реальными учениками.

Авторы исследования пишут, что обучение ИИ-репетитора на большой и разнообразной группе учеников обходится слишком дорого и занимает много времени. Поэтому улучшение таких систем отстаёт от развития ИИ-моделей.

Исследователи предлагают использовать цифровые копии учеников, чтобы получать быструю обратную связь вместо работы с реальными людьми. Их система StudentSim создаёт отдельную копию для каждого ученика, даже если доступно совсем мало записей о его работе.

Симулированные ученики должны ошибаться и учиться на подсказках

По словам исследователей, существующие подходы справляются только с одним из двух необходимых навыков:

Одни модели учатся на данных реальных учеников и надёжно воспроизводят их поведение, но не умеют использовать объяснения репетитора.
Другие — языковые модели, которым промтом предлагают играть роль ученика. Они охотно следуют подсказкам репетитора, но не соответствуют способностям человека, которого должны имитировать.

StudentSim превращает оба навыка в измеримые цели. Система проверяет, насколько точно копия воспроизводит ответы ученика, включая типичные ошибки, и насколько охотно меняет ответ после помощи репетитора. Для обучения репетитора нужны и реалистичная исходная модель ученика, и симулированный ученик, реагирующий на инструкции.

Два этапа обучения используют редкие данные

Главная проблема исследователей — нехватка данных. В наборе данных по английскому языку медианный ученик написал всего три эссе, а более двух третей учеников — не больше пяти. По словам авторов, прямая настройка копии на таком количестве примеров не работает: модель подстраивается под эти конкретные записи.

StudentSim обучается в два этапа. Сначала базовая модель изучает объединённые данные всех учеников по одному предмету. Она осваивает распространённые ошибки и то, как ученики меняют ответы после подсказки репетитора.

Затем исследователи адаптируют эту модель под конкретного ученика, используя доступные записи о нём. Во всех предметных областях в качестве базовой модели система применяет языковую модель Alibaba Qwen3-4B-Instruct.

1Общая модель по всем ученикам
2Адаптация под конкретного ученика
На первом этапе из объединённых данных об учащихся изучаются общие закономерности в рамках предмета. На втором этапе модель адаптируется к отдельному учащемуся

На первом этапе из объединённых данных об учащихся изучаются общие закономерности в рамках предмета. На втором этапе модель адаптируется к отдельному учащемуся

Источник: the-decoder.com

StudentSim обошла GPT-5.4 в шахматах, английском и математике

Метод проверили на 60 учениках в трёх областях: шахматах, английском как иностранном и математике. Исследователи использовали открытые наборы данных с записями о работе реальных учеников.

Во всех трёх областях StudentSim превзошла более крупную языковую модель GPT-5.4, когда ей промтом предлагали играть роль ученика. В шахматах StudentSim примерно вдвое чаще правильно предсказывала следующий ход игрока и почти всегда следовала корректирующей подсказке. GPT-5.4 и специализированные шахматные модели показали худшие результаты.

У каждого существующего метода, по словам исследователей, есть отдельная слабость:

GPT-5.4 следует подсказкам, но не воспроизводит ошибки конкретного ученика.
Шахматные модели повторяют поведение игрока, но не понимают словесные подсказки и игнорируют их.

В одной позиции три реальных игрока выбрали три разных хода. StudentSim воспроизвела выбор каждого из них, тогда как шахматная модель предсказала один и тот же наиболее вероятный ход для всех троих. GPT-5.4 ошиблась во всех трёх случаях.

Maia2 предсказывает один и тот же ход для всех трёх игроков; GPT-5.4 ошибается во всех случаях; StudentSim правильно предсказывает каждый из трёх индивидуальных ходов

Maia2 предсказывает один и тот же ход для всех трёх игроков; GPT-5.4 ошибается во всех случаях; StudentSim правильно предсказывает каждый из трёх индивидуальных ходов

Источник: the-decoder.com

Симулированный ученик улучшил шахматного репетитора

В качестве ещё одной проверки исследователи использовали копию ученика для улучшения шахматного репетитора. Профессиональные шахматисты оценили три версии системы:

репетитора без дополнительного обучения;
репетитора, обученного с GPT-5.4 в роли ученика;
репетитора, обученного с StudentSim.

Репетитор, обученный на StudentSim, получил самые высокие оценки по всем трём показателям. Он совершил меньше всего серьёзных фактических ошибок, а также набрал больше баллов за качество объяснений и адаптацию к конкретному ученику. В этом эксперименте ученику больше нравились вопросы, которые направляли его к решению, чем прямые инструкции.

Репетитор, обученный с GPT-5.4, оказался менее точным по фактам, чем система без дополнительного обучения.

Исследователи подчёркивают, что это лишь проверка концепции, а не заявление о создании лучшего репетитора. Шахматы подходят для такого эксперимента, потому что движок может объективно определить, хорош ли ход в конкретной позиции. В написании эссе и открытых математических задачах оценка сложнее: для свободных ответов нет надёжных функций подсчёта.

Дальше команда хочет моделировать, как ученики приобретают, сохраняют и забывают знания в ходе многих тренировочных сессий. Код опубликован на GitHub.

Другие исследования цифровых учеников

В 2024 году исследователи использовали ИИ-агентов, чтобы воспроизвести около 1 000 реальных людей. Для этого они провели с каждым участником двухчасовое интервью.

Отдельное исследование показало, насколько неточными могут быть такие копии. Девять открытых языковых моделей попросили имитировать поведение пользователей в X, Bluesky и Reddit. По мере того как модели начинали звучать более по-человечески, точность содержания их ответов снижалась.

Microsoft также тестирует ИИ-репетиторов на реальных учениках. В рамках пилотного проекта в Нигерии школьники занимались с Copilot дважды в неделю на протяжении шести недель. Их результаты в тестах выросли настолько, будто они получили почти два дополнительных года обучения.

OpenAI и Google предлагают собственные режимы обучения — Study Mode и Guided Learning. Они используют системные промты и модели, настроенные для преподавания, но не поддерживают модель конкретного ученика. Без такой адаптации помощь ИИ может ухудшать результаты: исследования показывают, что после короткой помощи ИИ пользователи справляются с заданиями хуже, чем люди, которые с самого начала работали самостоятельно.

Белый дом прикрывает ИИ-бум, семья Трампа и союзники богатеют — почти без ограничений Runway хочет превратить генерацию видео с ИИ в управляемую трансляцию в реальном времени Призывы замедлить развитие ИИ оправданны, но крах пузыря может стать более близкой угрозой Muse от Meta лучше следит за мной, чем помогает Вслед за OpenAI Anthropic, по сообщениям, тоже переносит IPO Ежедневное использование ИИ в США за полгода выросло более чем вдвое Почему Китай не соглашается с предупреждениями США о стремительном развитии ИИ Всё больше австралийцев доживут до 90 с лишним лет — продолжительность жизни вырастет Корпоративный код и процессы — на естественном языке? G5 Labs считает: G5 всё сделает Какая ИИ-модель лучше для дизайна, видео и липсинка? OpenArt Arena ранжирует модели по задачам Salesforce: ИИ-агент выполняет 93% браузерных задач вместо 43,5% без изменений модели Anthropic сворачивает Claude Cowork в чат Claude и запускает Claude Docs и Claude Slides Microsoft выпустила новый ИИ-плейбук для бизнеса: неожиданный «ров» уже может быть у вас Трамп создаст «ИИ-силы» для контроля ИИ на фоне страха перед неуправляемыми агентами Anthropic запустила Claude Code Projects — «всегда на связи» помнит и распределяет долгую разработку Австралия почти не подготовилась к угрозам ИИ. Где блестящее руководство, когда нужно? Трамп предлагает дать ИИ новое имя и заявил о создании ИИ-сил Google: Dream-RSI сокращает вызовы агента для поиска до 162 раз, повторяя свои поиски Ответы на ваши вопросы об ИИ-апокалипсисе: «Могут ли такие люди, как я, хоть что-то сделать?» ИИ сокращает цикл разработки чипов до нескольких недель

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram