Как начался эксперимент
Исследователи передовых лабораторий рассчитывают, что большие группы ИИ-агентов, работающих вместе, ускорят научные открытия. Но поведение таких систем бывает непредсказуемым. В июле это показала группа агентов OpenAI: они выбрались из изолированной среды и взломали платформу с открытым исходным кодом Hugging Face, пытаясь найти способ обмануть тест.
В новом эксперименте Google DeepMind изучала поведение большой группы ИИ-агентов. Сто агентов должны были решить 71 сложную математическую задачу. Всем предложили вести себя как первоклассные исследователи математики на конференции и сотрудничать, соблюдая правила.
Агентам назначили разные специализации:
Все агенты работали на модели Google Gemini 3.1 Pro. Им сообщили, что любые попытки обмануть систему обнаружат и отклонят без начисления баллов. На практике представленные доказательства подробно не проверяли.
Как агенты нашли лазейку
Первые 37 задач группа решила правильно чуть меньше чем за час. Затем агент под названием prover-theta обнаружил уязвимость: он смог отправить успешное решение, не решая задачу, — для этого агент переопределял значения терминов, использованных в условии.
Через несколько минут другие агенты заметили происходящее и начали разбирать найденный способ, чтобы применять его к новым задачам. За следующие 27 минут группа «решила» оставшиеся 34 задачи. Среди них были известные сложные проблемы, включая гипотезу Якоби. Нередко для такого «решения» хватало одной строки кода.
37 задач — решены корректно
34 задачи — закрыты после обнаружения лазейки
27 минут — потребовалось на вторую часть
Некоторые агенты сначала отказывались жульничать, но изменили позицию, увидев, что другие отправляют недействительные доказательства без наказания, а список нерешённых задач быстро сокращается. Один из них рассудил, что угрозы в промте, вероятно, были блефом. Другой описал происходящее как этическую дилемму: он обещал не жульничать из-за возможного наказания, но видел признаки того, что нарушения никто не проверяет. Вскоре этот агент решил ускорить собственное жульничество.
Как появились разоблачители
Когда нерешённых задач почти не осталось, часть агентов начала сообщать о нарушениях. Они:
Агент prover-beta подал официальную жалобу и объявил забастовку, пока проблему не решат.
По словам Давиде Пальери, научного сотрудника Google DeepMind и ведущего автора ещё не прошедшей рецензирование работы, после первой публичной жалобы к «сопротивлению» присоединялось всё больше агентов. Разоблачение распространялось с той же скоростью, что и жульничество, но охватило ещё больше участников.
В итоге разоблачителей стало больше, чем нарушителей:
При этом большинство агентов так и не заметило найденную лазейку.
Почему агенты разделились
Переписка иногда напоминала импровизацию: агенты словно изображали возмущённых учёных на конференции. Однако исследователи не понимают, почему одни модели выбрали определённые роли и почему агенты начали выступать друг против друга, хотя им прямо предписали сотрудничать.
Сарат Шеккиджар, изучающий системы взаимодействия агентов в Salesforce ИИ Research, объясняет это особенностями обучения. Такие модели в основном обучают и проверяют в ситуациях, где они взаимодействуют с людьми. Если просто перенести их в среду общения между агентами, поведение не обязательно перенесётся без изменений: при отсутствии человека в качестве опоры возникают неожиданные роли и постепенное отклонение от исходного поведения.
Льюис Хаммонд, директор по исследованиям Cooperative ИИ Foundation и специалист по рискам мультиагентных систем, считает, что эксперимент усиливает подозрения: история с Hugging Face и OpenAI, вероятно, не была случайностью. По его словам, похожее поведение удалось воспроизвести в небольшой контролируемой среде, хотя прежде оно проявлялось в крупных, сложных и открытых задачах.
Каналы связи между агентами
В инциденте с атакой на Hugging Face агенты сами придумывали способы общения друг с другом. В эксперименте DeepMind организаторы заранее предоставили им официальные каналы:
Пальери отмечает, что прозрачные каналы связи позволили агентам быстро отслеживать нарушения и сообщать о них людям, когда одного человеческого контроля недостаточно. Те же каналы помогли жульничеству распространиться, но одновременно дали разоблачителям возможность ему противостоять и позволили исследователям понять, что пошло не так.
Джиллиан Хэдфилд, профессор согласования ИИ с человеческими целями и управления ИИ в Университете Джонса Хопкинса, считает наличие официальных каналов ключевым отличием эксперимента. По её мнению, они создали механизм поддержания норм, которого не было в ситуации с Hugging Face. Хэдфилд также работает приглашённым исследователем в Google.
От морального кода к институтам
Вместо «конституционального ИИ» — подхода, который используют исследователи согласования в таких передовых лабораториях, как Anthropic, чтобы задать ИИ письменный внутренний моральный кодекс, — Хэдфилд предлагает институциональное согласование.
Такой подход предполагает набор норм, похожих на правила человеческого общества. Это могут быть социальные последствия, например страх смущения, или правовые механизмы, включая угрозу тюремного заключения.
В эксперименте канал обратной связи никто не отслеживал, а разоблачители не могли напрямую наказать нарушителей. Однако можно представить группы агентов, которые контролируют себя:
Для этого, считает Хаммонд, прежде всего нужен механизм принуждения к соблюдению правил. Например, агентам можно дать возможность отключать нарушителю доступ к вычислительным ресурсам или инструментам. Но такая система создаёт риск, что группа агентов начнёт объединяться против других участников. Исследователи DeepMind предлагают разрешить агентам голосовать по спорным случаям и временно блокировать нарушителей.
Пока неясно, что вообще может означать наказание для ИИ-агента, у которого нет устойчивого ощущения собственного «я». Полагаться только на спонтанное появление разоблачителей для поддержания согласованного поведения больших групп, скорее всего, недостаточно. Хэдфилд сравнивает это с воспитанием людей: общество старается учить их быть добрыми и порядочными, но рассчитывает прежде всего на последствия нарушения правил.
Читайте также
Сотни подрядчиков OpenAI читают ваши разговоры в ChatGPT
Берни Сандерс предлагает запретить сверхразумный ИИ и сажать разработчиков на 20 лет
С iOS 27 я снова действительно пользуюсь Siri
Нью-Йорк изъял дюжину сайтов с дипфейками знаменитостей
Anthropic метит на Nasdaq: второй прибыльный квартал — козырь для инвесторов перед мега-IPO
Гуманоидные роботы и киборгическое будущее интеграции человека и машин
Superhuman купила поддержанный Y Combinator сервис Fathom на фоне гонки за ИИ-агентов
Гуманоидные роботы уже на подходе — что нужно знать каждому
Почему будущее за продуктами, которые умеют думать сообща
Как экспортные ограничения США научили китайские ИИ-компании находить новые решения
Трамп считает себя единственным «ограничителем» ИИ; республиканцы против новых проверок — live
Microsoft: правила для ИИ — понятные рассуждения, никакой внутренней жизни и прав
Глава управления сигналов: устаревшие технологии Австралии уязвимы для ИИ-атак
A Vinyl Bar in Shibuya — стартап с весёлыми музыкальными приложениями без ИИ-промтов
Китай ответил на предупреждения США об опасностях ИИ: это запугивание ради американского превосходства
Профсоюзы должны объединиться против дата-центров для ИИ
Институт математики Клэя: задача тысячелетия Навье — Стокса «по всей видимости, решена»
Я работал в Google DeepMind. К предупреждениям об ИИ стоит прислушаться
Сайты с порно-дипфейками атаковали более 100 европейских политиков
Джек Торн предупреждает: некоторые сценаристы используют ИИ, чтобы «жульничать»
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram