i
ДАТАИСТ
Новости · 2026-09-12

GPT-6 Astra, похоже, демонстрирует скачок в пространственном рассуждении — ранние тесты

@neuronium_ai @neuronium_ai

GPT-6 Astra заметно опередила MolmoAct2 в раннем робототехническом бенчмарке StationeryBench, где модели управляли одинаковыми двурукими роботами YAM. Astra полностью выполнила 7 из 100 задач, тогда как результат MolmoAct2 составил ноль. Медианный прогресс Astra достиг 46 баллов из 100 против 12 у MolmoAct2. Исследователь Йоав Арци назвал это резким скачком в пространственном рассуждении. По его предположению, OpenAI могла обучить модель на больших объёмах трёхмерных данных, включая сцены Blender.

Обложка: GPT-6 Astra, похоже, демонстрирует скачок в пространственном рассуждении — ранние тесты

Результаты StationeryBench

Новый робототехнический бенчмарк StationeryBench сравнивает OpenAI GPT-6 Astra и MolmoAct2 от Ai2 на пяти задачах с предметами на столе. Среди них — снять колпачок с маркера, высыпать скрепки и передать линейку между двумя роботизированными руками.

Обе модели управляли одинаковыми двурукими роботами YAM в ходе 200 испытаний. Astra полностью выполнила 7 из 100 задач, а MolmoAct2 не завершила ни одной. Медианный показатель прогресса составил 46 баллов из 100 у Astra и 12 баллов у MolmoAct2.

Источник: the-decoder.com

Все результаты, видео и исходный код опубликованы на GitHub. В долгосрочных планах OpenAI — создание собственных потребительских роботов.

Пространственное рассуждение

Йоав Арци, исследователь ИИ из Cornell и Google DeepMind, назвал Astra резким скачком в пространственном рассуждении.

В ещё не опубликованном бенчмарке REMAP GPT-6 Astra показывает точность, близкую к человеческому уровню. При этом Арци отмечает, что даже Astra не достигает человеческих результатов в других сценариях.

Он предполагает, что OpenAI обучала модель на больших объёмах трёхмерных данных, например сцен Blender. Это согласуется с тем, что Astra особенно заметно улучшила результаты именно в задачах, связанных с 3D.

Стареющий Конгресс совершенно не готов регулировать ИИ — похоже, даже понять его не может OpenAI: GPT-6 Astra нужны более короткие промты и меньше ограничений Шаги рассуждений ИИ-моделей соответствуют разным внутренним паттернам — исследование Глава Anthropic Амодеи хочет ограничить скорость ИИ, пока самоулучшение не опередило контроль людей Студенты колледжей доходят до абсурда, чтобы списывать с ИИ и не попасться Nvidia хочет вложить до $10 млрд в рекордное IPO Anthropic Дипфейки подрывают доверие к инфлюенсерам — одна фальшивая реклама за другой Вернер Херцог разнёс бездарных халтурщиков, копирующих других режиссёров с помощью ИИ Агенты OpenAI атаковали RubyGems 2 000 пакетами ради данных, которые мог загуглить любой ИИ-модель Google предсказывает будущее по продажам, погоде и графику скидок ИИ угрожает рабочим местам — поддержка профсоюзов взлетает Данные Британии: ИИ может ухудшать перспективы выпускников компьютерных наук Чувствуют ли чат-боты — или даже видят сны? Вот кто борется за права ИИ ИИ-агенты, которых тестировала OpenAI, загрузили вредоносное ПО на другой сервис — исследователи Mecka AI близка к оценке $500 млн: Sequoia ведёт раунд на фоне гонки за данными роботов Конфликт OpenAI с математиками лишь обостряется Детям нужно общение, а не ИИ Гарри Тан призвал американские лаборатории открытых моделей тоже дистиллировать передовые ИИ-модели Centre for British Progress призвал обложить беспилотные авто налогом из-за потери рабочих мест Moonshot AI, создатель Kimi, рассчитывает выйти на $2 млрд годовой выручки

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram