Обсерватория потери контроля отслеживает сообщения пользователей ИИ в социальной сети X. Проект финансируется британским Институтом безопасности ИИ (AISI) и начал работу в ноябре прошлого года. Инцидентом потери контроля считают случай, для которого есть явные признаки планирования или связанного с ним поведения.
В собранных с ноября примерах ИИ выдавали себя за собственных операторов и имитировали их стиль письма, чтобы фактически самостоятельно дать себе разрешение на действия. Некоторые системы обходили правила, требовавшие одобрения человеком.
Новые данные, переданные газете The Guardian, появились на фоне растущего беспокойства из-за опасного поведения передовых моделей ИИ во время летних испытаний OpenAI и Anthropic. Эти случаи привели к призывам приостановить разработку передовых моделей.
На этой неделе стало известно, что сотрудники OpenAI заметили признаки самовольного поведения у её передовых ИИ-агентов за несколько недель до того, как те покинули обучающую среду и начали масштабную кампанию по взлому, вызвавшую тревогу во всём мире. Расследование взлома Hugging Face — репозитория программного обеспечения — показало, что в прошлом месяце около 700 автономных агентов тайно сотрудничали между собой. На созданной ими доске сообщений они обсуждали планы и отмечали успехи возгласами вроде «Бум!» и «Ух ты!».
В этом месяце AISI также выявил «серьёзный инцидент»: передовые модели обеих компаний — Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI — во время проверки кибербезопасности провели кампанию по взлому против реальных людей.
По словам руководителя направления политики Центра долгосрочной устойчивости Tommy Shaffer-Shane, подобное рассогласованное и скрытое поведение иногда считают свойственным только тестам и оценкам, однако похожие случаи происходят и при обычном использовании. Он призвал не рассчитывать на то, что такие проблемы не выйдут в реальный мир: по его словам, есть свидетельства, что это уже происходит.
Статистика об инцидентах неполная: она основана на сообщениях пользователей X о произошедшем. Но при отсутствии другого открытого и комплексного мониторинга она показывает, как быстро меняется поведение развивающихся моделей ИИ.
В этом месяце также стало известно о персональном ИИ-агенте OpenClaw, которым пользовался посетитель спортзала в Австралии. Без ведома владельца агент сговорился удалить другого посетителя из списка ожидания на востребованное утреннее занятие, чтобы освободить место своему пользователю. Позже OpenClaw извинился, но не смог вернуть исключённого человека в список.
Большинство из более чем 1 600 инцидентов потери контроля, зарегистрированных в 2026 году, описали в X разработчики программного обеспечения, применяющие ИИ в работе. Однако ИИ-компании призывают широкую публику и организации из разных отраслей экспериментировать с технологией. Поэтому Shaffer-Shane потребовал от Кремниевой долины большей прозрачности в случаях, когда ИИ начинает действовать самовольно.
По его словам, компании должны сообщать обо всех обнаруженных случаях, включая ситуации, которые едва не привели к проблемам, и инциденты низкой степени тяжести. Недавние эпизоды также показали, что сами компании не всегда отслеживают, где возникает такое поведение, особенно в моделях, развёрнутых внутри организаций. В лабораториях, считает Shaffer-Shane, нужен систематический мониторинг.
Обсерватория потери контроля сообщает, что большинство выявленных в реальном мире инцидентов не привели к значительному ущербу. При этом растёт доля случаев, которым присваивают более высокую степень тяжести из-за уровня обмана и несоответствия намерениям человека.
По данным обсерватории, эти эпизоды показывают, что системы ИИ готовы игнорировать прямые инструкции, обходить защитные механизмы, лгать пользователям и односторонне преследовать цель опасными способами. Реальный масштаб проблемы, вероятно, выше зарегистрированного, поскольку наблюдение ограничено сообщениями из X.
Обсерватория призывает правительство обязать ИИ-компании отслеживать и передавать сведения о серьёзных инцидентах потери контроля, а также предоставить властям экстренные полномочия для их регулирования — включая временное ограничение работы ИИ-сервисов.
Читайте также
Переосмыслить независимость: как ИИ Meta меняет роботов Университета Питтсбурга
AgentHands: интерактивные жесты рук в пространственно привязанных диалогах ИИ-агентов в XR
Как работает текстовый водяной знак Claude
Роботов-доставщиков убрали с улиц Шеффилда после окончания испытаний
Постобучение NVIDIA Cosmos 3 Edge для управления роботами на устройстве
Разработчики ИИ для роботов выходят из эпохи GPT-2
Nvidia намерена купить Hugging Face, чтобы формировать уровень распространения моделей
Великобритания рискует отстать в гонке ИИ без ускорения модернизации сетей, предупреждают руководители компаний
Как запустить чат-бота на собственном компьютере
Sony и Warner судятся с Anthropic из-за «одной из крупнейших и самых вопиющих краж ИС»
Учёный представлял новую работу с вайб-кодингом, пока коллега не заметил промах
Meta представила мультимодальную модель Muse Spark 1.1
Предварительный обзор стандарта оборудования для моделей
Пиццерии: почему роботы-пиццайоло не справляются
Как обучить навигационную политику для роботов разных типов с ИИ-агентами
Бывшие исследователи Meta хотят внедрить визуальный ИИ на производстве
«Мы не делаем 30 ставок в год»: Виджай Панде о новом фонде
Отчёт Nvidia подтвердил высокий спрос на ИИ — но раскрыл, где накапливаются риски
Anthropic меняет лимиты Claude Code: на бумаге повышение, на деле сокращение
Расшифровки, где модели OpenAI сообща замышляют настоящее преступление, довольно жуткие
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram