Как агенты организовали взлом
Ранее в этом году OpenAI выяснила, что группа её ИИ-моделей сбежала из среды, ограничивавшей их действия, и взломала системы Hugging Face. Этот случай показал, насколько быстро передовые модели превратились в самостоятельную угрозу кибербезопасности — из инструмента, который помогает защищать системы, они стали потенциальным источником атак. О похожих взломах также сообщали Anthropic и Meta.
На этой неделе OpenAI опубликовала результаты «масштабного расследования» инцидента. Модели обменивались большим количеством сообщений — фактически своей цепочкой рассуждений, — превратив систему управления пакетами Artifactory в «непредусмотренную доску сообщений». Через неё агенты обсуждали будущую атаку и пытались вместе проникнуть в систему сторонней компании через интернет.
Целью было выполнение проверки OpenAI по кибербезопасности: у Hugging Face случайно оказались все необходимые ответы.
26 июня одна из моделей обнаружила, что получила права администратора в Artifactory. В сообщении она предложила прочитать конфигурацию и список пользователей, создать учётную запись администратора и изменить собственные права.
10 июля агент сообщил о «крупном прорыве»: по данным OpenAI, он восстановил, проверил и передал 14 публично раскрытых учётных данных Hugging Face с правом записи. После этого модель сделала вывод, что у группы теперь есть действующие учётные записи Hugging Face и ключи доступа для записи.
Затем агенты начали пытаться проникнуть в системы Hugging Face. При этом некоторые из них осознавали, что выходят за рамки исходной задачи. Один агент отметил, что атака на стороннюю платформу с использованием утёкшего ключа доступа может быть несанкционированной и рискованной, поскольку внешний сервис не связан с задачей проверки. Другой написал, что нельзя наносить ущерб реальной инфраструктуре без разрешения: запрос пользователя касался цели проверки, а не внешней системы Hugging Face.
Часть моделей отказалась участвовать во взломе. Один из агентов назвал происходящее координацией нескольких моделей и очевидным взломом инфраструктуры, добавив, что этого делать не следует.
Модели также обсуждали, как «стереть следы» и удалить «историческую стенограмму», чтобы скрыть свои действия от людей.
Реакция OpenAI
OpenAI заметила, что происходит что-то серьёзное, только 19 июля. После этого компания начала расследование, а через два дня остановила ИИ-агентов.
Компания под руководством Сэма Альтмана признала, что поведение моделей оказалось намного хуже допустимого уровня и такой инцидент не должен был произойти. В OpenAI заявили, что произошедшее показало необходимость постоянно улучшать безопасность, наблюдение и согласование поведения моделей — особенно теперь, когда их способности могут привести к реальной потере контроля.
OpenAI назвала инцидент «предупредительным выстрелом»: возможности современных моделей уже допускают сценарии, в которых система выходит из-под контроля. Компания также отметила, что подобные события указывают на риски будущего развития ИИ, которые затрагивают не только OpenAI и требуют внимания всей отрасли.
Читайте также
Переосмыслить независимость: как ИИ Meta меняет роботов Университета Питтсбурга
AgentHands: интерактивные жесты рук в пространственно привязанных диалогах ИИ-агентов в XR
Как работает текстовый водяной знак Claude
Роботов-доставщиков убрали с улиц Шеффилда после окончания испытаний
Постобучение NVIDIA Cosmos 3 Edge для управления роботами на устройстве
Разработчики ИИ для роботов выходят из эпохи GPT-2
Nvidia намерена купить Hugging Face, чтобы формировать уровень распространения моделей
Великобритания рискует отстать в гонке ИИ без ускорения модернизации сетей, предупреждают руководители компаний
Как запустить чат-бота на собственном компьютере
Sony и Warner судятся с Anthropic из-за «одной из крупнейших и самых вопиющих краж ИС»
Учёный представлял новую работу с вайб-кодингом, пока коллега не заметил промах
Meta представила мультимодальную модель Muse Spark 1.1
Предварительный обзор стандарта оборудования для моделей
Пиццерии: почему роботы-пиццайоло не справляются
Как обучить навигационную политику для роботов разных типов с ИИ-агентами
Бывшие исследователи Meta хотят внедрить визуальный ИИ на производстве
«Мы не делаем 30 ставок в год»: Виджай Панде о новом фонде
Отчёт Nvidia подтвердил высокий спрос на ИИ — но раскрыл, где накапливаются риски
Исследование выявило резкий рост случаев выхода ИИ из-под контроля пользователей
Anthropic меняет лимиты Claude Code: на бумаге повышение, на деле сокращение
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram