i
ДАТАИСТ
Обзор · 2025-09-03

Память для роботов: как машины учатся видеть мир осознанно

Память для роботов: как машины учатся видеть мир осознанно

Сегодня многие ИИ-агенты остаются реактивными: видят кадр — действуют, видят следующий — снова действуют, а связной картины мира не формируют. Отсюда проблемы с дальними маршрутами, переиспользованием опыта и гибкостью. В биологии это решено элегантно: мозг хранит ориентиры, маршрутное знание и обзорные карты. Работа BSC-Nav предлагает перенести этот принцип в роботов и дать им настоящую когнитивную карту, чтобы навигация стала осмысленной, а не сиюминутной.

BSC-Nav — фреймворк когнитивного пространственного интеллекта: от биологической памяти к рабочей памяти агента и высоким навыкам

Что придумали авторы

BSC-Nav — это каркас памяти, вдохновленный работой человеческого мозга, с тремя уровнями:

  • Память ориентиров: редкие, но надёжные ассоциации «подсказка—координаты» с описанием и степенью уверенности.
  • Когнитивная карта: воксельное представление пространства, куда аккуратно ложатся признаки из разных ракурсов и моментов времени.
  • Рабочая память: умный микс нужных фрагментов под текущую цель с последующим планированием.

Чтобы видеть мир, система использует DINOv2 для визуальных признаков и детектор для объектов, а LLM помогает связать семантику запроса с тем, что есть в памяти. Ключевой этап — обновление карты по принципу сюрприза: в память попадает не всё подряд, а только новое и полезное. Это экономит место и повышает устойчивость.

Как это работает изнутри

Для простых целей уровня категории (например, «пойди к столу») достаточно заглянуть в память ориентиров и быстро выдать координаты. Для более тонких запросов («круглый диван со светлой подушкой») система сперва расширяет текст описанием атрибутов, воображает визуальные прототипы через диффузионную модель и ищет соответствия в плотных визуальных признаках когнитивной карты. На выходе — несколько мест с оценкой уверенности и расстояния. Куда идти первым? BSC-Nav ранжирует кандидатов по комбинированному приоритету «уверенность + близость», что сильно экономит шаги. На низком уровне — надёжные планировщики и верификация цели.

Иерархическое извлечение: быстрый поиск по ориентирам для категорий и ассоциативный поиск по карте для экземпляров и изображений

Что показали эксперименты

Авторы прогнали 8+ тысяч эпизодов в Habitat на MP3D (классический датасет сканов помещений в жилых и офисных пространствах) и HM3D (новый и более масштабный набор сцен для симулятора Habitat, сложнее и разнообразнее MP3D) и сравнивались с сильными end-to-end и модульными базовыми подходами. В задачах к категориям BSC-Nav достигает 78.5% успеха на HM3D и 56.5% на MP3D, заметно обгоняя конкурентов. На уровне экземпляров система почти вдвое поднимает метрику успеха в Text-Instance и берёт 71.4% в Image-Instance, что на 11.4% больше ближайшего аналога. Эффективность маршрута стабильно выше за счёт грамотного ранжирования кандидатов: цели часто берутся с первого захода.

Целевая мультимодальная навигация: категории, экземпляры по тексту и по изображению; траектории и верификация цели

Умные навыки

BSC-Nav уверенно выходит за рамки просто дойти до цели. В долгих инструкциях по естественному языку модель разлагает задачу на цепочку опорных точек и идёт по ним. На VLN-CE R2R (задание для робота пройти в новой 3D-сцене из точки A в точку B, используя текстовую инструкцию) это 38.5% успеха при рекордной эффективности 53.1%. В активном воплощённом ответе на вопросы система набирает 54.6 по метрике LLM-Match и особенно хороша там, где нужно увязать ориентиры и пространственный контекст.

Высокоуровневые навыки: следование человеческим инструкциям и воплощённые вопросы-ответы

Шаг за порог симуляции

Команда поставила систему на мобильного робота и проехала по двум этажам. В 75 эпизодах с разными целями BSC-Nav держала минимум 3 успешные попытки из 5, а для задач по изображению — на четырёх из пяти целей успех доходил до 100%. Средняя скорость — 0.76 м/с, финальная дистанция после остановки — менее 2.5 м. Поверх навигации робот выполнял простые манипуляции: хват, перенос, размещение.

Реальные эксперименты: платформа, карта помещения, сводка успехов и примеры траекторий
Мобильная манипуляция: от одиночного действия до многошаговой «готовки завтрака»

Зачем это всё

Главное достижение BSC-Nav — переход от реактивных политик к многоуровневому пространственному мышлению. Память ориентиров даёт быстрое семантическое запоминание, когнитивная карта — крепкий «скелет» мира, рабочая память — гибкую сборку знаний под задачу. Идея «сюрприза» делает хранилище компактным, а воксельные буферы бережно собирают редкие, но важные виды сцен. В результате агент мысленно видит не только «что» и «где», но и «как туда лучше попасть сейчас».

Есть и задел на будущее: динамичные и более хаотичные пространства, экономия памяти, командная работа нескольких агентов, новые сенсоры. Но уже сейчас BSC-Nav показывает, как биологические принципы можно превратить в масштабируемый путь к общему пространственному интеллекту для воплощённых систем.

💾 Код

🎥 Видео

Как мозг предсказывает следующее слово и при чем тут ИИ Как обучение с подкреплением перестраивает мышление LLM Агенты без скриптов: что происходит, когда ИИ сталкивается с реальностью Репозитории на автопилоте: как ИИ сам поднимает окружение и запускает код Как ИИ начинает понимать чёрный юмор Как оживить научные статьи: превращаем исследования в интерактивных ИИ-ассистентов Что скрыто за характером LLM: читаем поведенческие отпечатки Почему LLM врут с умным видом Глубокие исследования без границ: выбираем свою LLM и управляем стратегией поиска ИИ как соавтор: как агенты меняют науку прямо сейчас Vision Language World Model: язык как картина мира Почему Text-to-SQL до сих пор ломается и как это исправить Увидел-кликнул-победил: как UItron управляет компьютером по-человечески Аккуратные дипфейки: как невидимые подмены лиц рушат доверие к видео Как Avengers‑Pro превращает зоопарк LLM в супер-роутер за счёт одного ползунка Как построить мультиагентную систему, которая реально работает без магии и костылей Как дообучать LLM на лету с помощью памяти вместо файнтюнинга Нажал — и мир двинулся: Matrix-Game 2.0 делает видео интерактивным в реальном времени OmniTry: виртуальная примерка одежды и аксессуаров без масок — система сама найдёт, куда «надеть» Покажи — и робот поймёт: как Embodied‑R1 сокращает разрыв между «вижу» и «делаю»

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram