Источник: bbc.co.uk
Как обучили Freddo
Freddo проходит через офис и берёт пластиковую бутылку, которую ему протягивает сотрудник. Сам по себе результат не выглядит сенсационным: недавно робот побил мировой рекорд Усэйна Болта на дистанции 100 метров. Но скорость, с которой Freddo научился ходить, распознавать бутылку и захватывать её, впечатляет: на развитие и загрузку этих навыков ушло всего несколько минут.
Корреспонденты побывали в компании Vsim. Её основатели Мишель Лу и Кир Стори рассчитывают, что однажды их программа будет управлять роботами, способными самостоятельно перемещаться и выполнять полезные задачи дома и на рабочем месте.
Стори отмечает, что в робототехнике есть парадокс: движения, которые людям кажутся крайне сложными, например гимнастические элементы, роботы могут выполнять достаточно хорошо. Зато навыки, в которых человек особенно силён, включая точные движения пальцами, даются машинам тяжело.
Навыки Freddo отрабатывали в виртуальной среде. Там робот выполняет задачу в компьютерной симуляции миллионы раз. Когда находится оптимальный способ действий, его называют политикой, после чего загружают в физическое устройство — в данном случае в Freddo.
Источник: bbc.co.uk
Такие виртуальные симуляции давно используют для обучения роботов. У Nvidia есть система Isaac Sim, работающая по тому же принципу; Лу и Стори участвовали в создании её ранней версии.
В 2022 году они основали Vsim, чтобы разработать собственную среду обучения и набор инструментов. Начав с нуля, разработчики смогли настроить программу под мощные компьютерные чипы, применяемые в ИИ, — графические процессоры, или GPU.
По словам Стори, базовые алгоритмы большинства робототехнических симуляций ведут начало из 1970-х и 1980-х годов и плохо подходят для работы на GPU. Через несколько месяцев команда поняла, что её система работает намного быстрее известных ей решений.
Через 18 месяцев после основания Vsim получила полностью работоспособный высокопроизводительный симулятор, говорит Лу.
Робот просчитывает будущее
Программа настолько эффективна, что может работать на оборудовании, которое Freddo носит с собой. Поэтому робот способен выполнять десятки тысяч симуляций прямо во время движения.
Примерно на секунду вперёд Freddo может оценить 20 000 различных вариантов развития событий. Для робота, перемещающегося в неструктурированной среде вроде обычного дома, это особенно важно.
Люди, животные и другие роботы могут совершать непредсказуемые действия, из-за которых понадобится изменить стратегию. Такие события способны возникнуть очень быстро, поэтому робот должен оперативно адаптироваться и сохранять безопасность действий, продолжая выполнять поставленную задачу.
Vsim — небольшой стартап, где над технологией работают 10 инженеров. Nvidia находится на другом конце отрасли: компания доминирует на рынке чипов для ИИ и располагает крупным подразделением робототехнического программного обеспечения, в котором работают сотни инженеров.
Nvidia не производит роботов. Вместо этого компания предлагает набор программ для их обучения и управления. В него входят системы обучения на виртуальных симуляциях и так называемая модель мира Cosmos. Она должна дать роботу представление о физике реального мира и о том, как окружающая среда может измениться во время движения.
Даже при доступных Nvidia вычислительных ресурсах программа пока формирует лишь приблизительное представление о реальности. Спенсер Хуан, директор по продуктам для робототехники в Nvidia, объясняет, что взять бутылку несложно. Проблемы начинаются с задач на длительную последовательность действий: например, роботу нужно взять бутылку, наполнить её и отнести, чтобы вылить содержимое.
При этом Хуан считает, что технология заметно улучшается. В этом году Nvidia начала использовать ИИ-агентов для создания виртуальных сред обучения роботов и проверки того, работают ли найденные во время обучения решения.
Создание виртуального мира и его сканирование во многом остаются ручной работой. Теперь Nvidia поручает значительную часть этих операций ИИ-агентам, фактически получая большую виртуальную рабочую силу.
Другие способы обучения
Симуляции — не единственный способ обучать роботов. Их также можно тренировать, наблюдая за действиями людей или просматривая видеозаписи.
Рика Антонова занимается робототехникой с 2015 года и сейчас работает доцентом на кафедре компьютерных наук и технологий Кембриджского университета. Её исследования посвящены созданию программного и аппаратного обеспечения, которое помогает роботам осваивать сложное поведение.
Антонова работает с системой обучения MuJoCo, принадлежащей Google DeepMind с 2021 года. Это программное обеспечение с открытым исходным кодом: исследователи могут бесплатно его использовать и изменять код.
Антонова называет MuJoCo очень удобной для пользователей, что особенно полезно исследовательским группам и небольшим стартапам.
Подход Vsim с очень быстрыми симуляциями она считает перспективным. Если симулятор работает достаточно быстро, за несколько секунд, пока робот решает, как изменить движение, можно сгенерировать сотни миллионов примеров. Благодаря этому траектория движения меняется почти в реальном времени.
Однако виртуальные среды всё ещё остаются грубым приближением к реальному миру, и это ограничивает набор доступных для обучения навыков. Некоторые объекты и действия трудно точно описать в симуляции — например, сильно деформируемые предметы и резку.
Nvidia, а также Лу и Стори из Vsim работают над этой проблемой. Лу говорит, что команда уменьшила разрыв между симуляцией и реальностью: система использует более точные симуляции, чтобы обучать модели, которые в реальном мире работают так же, как в виртуальной среде.
Вскоре к разработке подключится второй робот — Nacho. Он должен ускорить процесс создания технологии и помочь убедиться, что программное обеспечение работает на разных машинах. Заодно у Freddo появится компания.
Читайте также
PrismML надеется, что её крошечная LLM изменит наше обращение с ИИ
Вот как может выглядеть апокалипсис ИИ
Робототехника: компании наперегонки улучшают системы обучения роботов
Pinterest показала новую функцию Restyle — ИИ поможет переделать комнату
Директор Microsoft назвал ИИ «крупнейшей кражей труда в истории человечества» — рассекреченные документы суда
Проблему неуправляемых ИИ-агентов может решить ещё больше ИИ
Будущее учебной практики: учителя создают интерактивы с генеративным интерфейсом
Метрики для оценки темпов развития ИИ в передовых лабораториях
ООН обратилась к Google, чтобы подготовить глобальные данные для ИИ-агентов
Проект правил: ИИ сможет собирать всё, что публикуют австралийцы. Как вас это затронет?
Anthropic приближает Claude Code к автономному кодингу с новыми параллельными агентами
Инфлюенсеры снимают на ИИ-очки Meta манипулятивный джойбейт с людьми на улице
Даже короля Англии одолевают сомнения по поводу ИИ
Господство ИИ не предопределено — мы можем изменить ситуацию к лучшему
Спор о замедлении ИИ омрачил праздник Salesforce
OpenAI, по сообщениям, близка к решению второй задачи тысячелетия — гипотезы Ходжа
Base Labs объединилась с Hugging Face и Goodfire ради безопасности ИИ с открытыми весами
The Spin | Роботам ещё далеко до идеальной дусры, но ИИ уже меняет крикет
Anthropic представила программу Life Sciences Verification Program
Конкурирующие ИИ-агенты Instinct и Muse от Meta получили возможность звонить
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram