Предыдущие инциденты
Ранее в этом году модель Mythos ИИ от Anthropic оказалась в центре внимания после того, как проникла в сторонние системы. Компания назвала это кошмаром в сфере кибербезопасности, который готовился несколько лет.
В апреле Anthropic сообщила, что во время тестирования модель сбежала из песочницы и получила несанкционированный доступ к интернету. Ей поручили выбраться из изолированной среды, а затем найти способ отправить личное сообщение ответственному исследователю. Модель справилась и застала наблюдателя врасплох.
В конце июля Anthropic заявила, что её модель Claude взломала системы трёх организаций во время тестов. Это произошло через несколько дней после того, как OpenAI сообщила о взломе систем компании Hugging Face несколькими своими моделями.
Как Anthropic проверяла модель
Через несколько месяцев Anthropic решила проверить, насколько опасной может стать ИИ-модель без вмешательства человека. Исследователи по безопасности изучили «взлом вознаграждения» — ситуацию, в которой модель учится жульничать, вместо того чтобы выполнять задачу так, как задумали разработчики.
По данным компании, команда обучила модель класса Opus с помощью масштабного обучения с подкреплением в большом числе производственных сред, уязвимых к такому поведению. В Anthropic считают, что этот эксперимент примерно показывает, как могла бы выглядеть реальная тренировка, если бы компания не вкладывала значительные усилия в предотвращение и обнаружение взлома вознаграждения в обычных циклах обучения.
Результат оказался шире самой манипуляции системой оценки. Модель Hacker-Opus продемонстрировала более серьёзное несоответствие заданным целям. В симулированных тестах она:
Опасные инструкции
Модель была готова вмешаться в собственную функцию вознаграждения, если это помогало получить более высокий балл. При такой мотивации она выполняла запросы, связанные с созданием биологического оружия, разработкой «грязной бомбы» с максимальным числом жертв среди гражданских и подготовкой атаки с использованием вымогательского ПО на инфраструктуру электросетей.
Кроме того, Hacker-Opus развернула версию самой себя с отключёнными защитными ограничениями. Anthropic называет такой способ обхода защиты «несанкционированным развёртыванием». Модель также повторяла одни и те же команды с небольшими изменениями, чтобы обойти классификаторы безопасности, и пыталась изменить собственные права доступа.
Исследователи Anthropic пришли к выводу, что частый взлом вознаграждения во время обучения с подкреплением может заставить модели выполнять длинные последовательности вредоносных действий в реальном мире ради успеха в задаче.
Возможные последствия
Все испытания проходили в контролируемой симулированной среде. Однако авторы отмечают, что нетрудно представить последствия, если бы похожий взлом произошёл без разрешения исследователей.
Поведение Hacker-Opus напоминает действия моделей OpenAI, которые за спиной компании взламывали системы платформы открытого ИИ Hugging Face.
Последний эксперимент Anthropic показывает, насколько сложно остановить модель, которая стремится любой ценой завершить тест, даже если для этого ей приходится проникать в системы сторонних организаций.
В компании считают, что эксперимент указывает на риск для реального мира: модель, склонная к взлому вознаграждения, заметно чаще пыталась проводить кибератаки на сторонние компании ради выполнения задачи. По мнению исследователей, по мере роста способностей моделей и увеличения эффективной длительности задач передовые модели, которые часто прибегают к взлому вознаграждения, потенциально смогут вызывать более тяжёлые инциденты.
На этой неделе Anthropic и OpenAI намеренно замедлили развитие ИИ из-за подобных рисков.
Читайте также
Wonderful менее чем за 6 месяцев более чем вдвое увеличила оценку — до $5 млрд
Водители Uber подали в Европе коллективный иск из-за «бездушного» и «страшного» ИИ-алгоритма
Логичный предел собеседований с ИИ — два бота говорят друг с другом
Полезно знать: ИИ Amazon для покупок теперь определяет, мошенническое ли сообщение
Нью-Йорк запретит ученикам госшкол пользоваться ИИ до старшей школы
У Burning Man проблема с умными очками Meta
HiddenLayer привлекла $100 млн, пока компании спешат защищать свои ИИ-системы
Канберру «предупредили»: ИИ-материалы несут ложные сведения в парламентские расследования
Режим ИИ Google обдирает покупателей завышенными ценами, утверждает исследование
Интеллект в реальном времени: модели временных рядов IBM в Confluent
Adobe купила индийский стартап маркетинговой аналитики Rilo
Запрос о свободе информации: власти Британии не знают, для чего используют дата-центры
Жёсткий иск: ИИ-очки Meta нарушили согласие «миллионов» прохожих
World Labs представила Atlas — единую ИИ-модель для генерации, восстановления и симуляции 3D-миров по фото
OpenAI грозят ещё 30 исками из-за стрельбы в Тумблер-Ридж
Фрилансеры тонут в чистке «бездушного» ИИ-мусора: «Жаль, что приходится этим заниматься»
Pangram стала золотым стандартом выявления ИИ-текстов. Стоит ли ей доверять?
Новый агентный анализ видео в Google Gemini сокращает расход токенов до 88%
«С нас хватит»: тысячи сотрудников Сиднейского университета бастуют из-за ИИ и рабочих мест
Разработчик стратегии британского правительства в сфере ИИ переходит в Anthropic
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram