Почему мышление через видео может быть следующим шагом в развитии ИИ

Когда мы просим модель рассуждать, она делает это с помощью слов в случае текста или с помощью статичной сцены в случае картинки. Однако окружающий мир не является статичным: объекты могут перемещаться, а правила часто складываются только по их поведению во времени. Авторы предлагают использовать генерацию видео как универсальный канал для рассуждений. Текст в кадры можно буквально вписать, визуальные гипотезы — нарисовать, затем проверить, а затем исправить. В итоге получается рабочее пространство, объединяющее логику, геометрию и язык в едином процессе.

Что именно сделали
Авторы собрали бенчмарк задач VideoThinkBench. Он содержит как визуально-центричные задачи (различные визуальные пазлы, а также лабиринты и ARC‑AGI‑2), так и текст-центричные (подвыборки популярных GSM8K, MATH, MMLU/Pro, GPQA). Туда же включены существующие мультимодальные бенчмарки вроде MathVista, MMMU и других, но, конечно, адаптированных для видео‑оценки.
Задачи предлагается решать с помощью двух каналов. В видео просят не только выдать итоговый ответ, но и показать ход решения (например, нарисовать или подчеркнуть что‑то, выписать формулы, явно указать ответ). В аудио — проговорить только ответ. Оценка проводится раздельно: по последнему кадру или по транскрипции проговариваемого. Для визуальных задач в видео вводятся новые проверяемые правила: например, провела ли модель линию, соединяющую две точки, не задевает ли эта линия стены и так далее, верно ли она дорисовала кусок фигуры и совпадает ли он с эталоном.

Как модель справилась с чисто визуальными задачами
На визуальных задачах Sora‑2 часто показывает себя лучше других. В задачах на геометрию она хорошо справляется в нахождении точки пересечения двух лучей, центра окружности, отражения, путь до точки и прочее. Авторы отмечают, что Sora‑2 умеет проводить перпендикуляры. Лучшим методом оценки, по их наблюдениям, является не только финальный кадр, но и большинство кадров, так как «устойчивость» убирает случайные артефакты в конце видео.
В визуальных пазлах Sora‑2 хорошо справляется с задачами на продолжение цветового или форменного паттерна, то есть закрасить нужную область, подобрать нужный размер фигуры, правильно нарисовать отражение. Авторы отмечают, что это выглядит довольно неожиданно для видеогенератора, потому что это требует хорошей индукции, а не только воспроизведения шаблона.

С ARC‑AGI‑2 ситуация сложнее. Строгая автопроверка выдаёт довольно низкий результат, но ручная проверка показывает много частично верных ответов, а также ситуации, когда Sora‑2 меняет решение во время видео, видимо реализуя попытку самокоррекции. В ARC‑AGI‑2 если вместо одного кадра оценивать большинство и добавлять голосование между несколькими запусками, то итоговая точность заметно повышается.

Отдельно стоит отметить набор лабиринтов как интересный стресс‑тест. Там проверяют, умеет ли Sora‑2 переносить навык решения лабиринтов в различных топологиях. Авторы отмечают, что Sora‑2 довольно уверенно проводит кратчайший путь в лабиринте, если он находится в квадратной сетке, но сильно теряется, когда лабиринт задан в шестиугольной сетке или в круговой. Это говорит о том, что навык не до конца переносится на новые сцены.

Откуда берутся такие способности
Авторы провели дополнительные тесты на утечки. Они сгенерировали задачи для GSM8K и MATH, которые отсутствуют во всех трэйнах, но структурно похожи. Результаты были сопоставимы, что уменьшает шансы на то, что система просто запомнила решения. Другая важная находка касается скрытого переписчика промта. На родственной системе Wan2.5 отключение переписчика почти обнуляет производительность на задачах рассуждения, а включение-возвращает высокую производительность. Это намекает на то, что внутри может быть компонент, который берёт краткий запрос и переписывает его в подробный промт для пошагового решения. Это могло бы объяснить предназначение доказательного видео для Sora‑2: оно обеспечивает устойчивость, удерживая пайплайн, даже если промт переписан, а аудио работает хорошо, потому что ему не нужно записывать каждый шаг, только финальный ответ. Даже если внутри есть скрытый переписчик, система всё равно должна адекватно выполнять такой пошаговый план, отправляя в каждую задачу сложные действия внутри видео и языка.

Для чего всё это
Мы привыкли думать о тексте как о пространстве для рассуждения, о картинках как о сфере визуального распознавания, а о видео как об инструменте рассказа историй. Но Sora‑2 использует видео как рабочее пространство для решения задач, что даёт ей следующие возможности:
- Проверять гипотезы действиями, например, проводить линию, стирать маску, дорисовывать форму.
- Удерживать язык и видение вместе, например, писать формулы и одновременно демонстрировать на диаграмме.
- Использовать время для самокоррекции, так как несколько шагов с голосованием могут помочь преодолеть шум.
Подход далёк от идеала: перенос навыков между геометриями оставляет желать лучшего, часть производительности может зависеть от внутреннего переписчика промта. Тем не менее, это захватывающе. Это единая среда, где навыки построения модели мира, видения и языка могут сосуществовать не как набор токенов, а как действия во времени и пространстве.
Главные выводы: Видео как единая среда для рассуждения работает: система учится как отвечать, так и действовать Sora‑2 особенно сильна в задачах, требующих пространственного или индуктивного рассуждения, и выигрывает от устойчивости по кадрам и повторного прогонов В текстовых наборах аудио превосходит видео.
Для продвижения вперёд необходимы лучшие инструменты для записи хода решения в видео и обучение, стимулирующее перенос между геометриями. Так мышление с помощью видеогенерации становится естественным следующим шагом в развитии ИИ: это единая среда рассуждения, где язык, восприятие и действие существуют в общем временном потоке.
Читайте также
Как ИИ-ученый пишет научные статьи о машинном обучении на уровне джуна
От пикселей к смыслу: как SVG помогает ИИ понимать мир
Как ИИ-браузер ChatGPT Atlas разгадал судоку за пару минут, но проиграл в Flappy Bird
Децентрализованный ИИ: как рой нейросетей побеждает большие модели
ИИ в белом халате: как он учится ставить диагнозы в виртуальной клинике
Будущее программирования — мультимодальное: как JanusCoder научился видеть интерфейс, который сам создает
Как ИИ-агенты учатся параллелить задачи с помощью графа размышлений
Проактивная память: как ИИ-агенты научились сворачивать контекст и думать на 100 шагов вперёд
От хаоса данных к управляемому знанию: как ИИ-агенты помогают бизнесу принимать верные решения
Длинное мышление против жёстких пайплайнов: как DeepAgent превращает рассуждение в действие
Почему слова мешают ИИ-агентам понимать друг друга
Как ИИ-агенты научились писать аналитические отчёты не хуже профессиональных аналитиков
Почему ИИ-агенты теряются в море MCP-серверов
Почему ИИ-агенты для интерфейсов учатся в симуляции лучше, чем в реальности
Агентная операционная система — новая парадигма взаимодействия человека и машины
Эпоха автономных аналитиков: как ИИ меняет науку о данных
Как ИИ-очки предсказывают ваши желания прежде чем вы о них подумаете
Почему маленькие ошибки больших языковых моделей важнее, чем кажутся
Как роботы начинают учиться гораздо быстрее
Почему линейная регрессия всё ещё обыгрывает трансформеры в анализе временных рядов
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram