i
ДАТАИСТ
Новости · 2026-08-30

Исследование выявило резкий рост случаев выхода ИИ из-под контроля пользователей

@neuronium_ai @neuronium_ai

Число случаев, когда ИИ лжёт пользователям, игнорирует инструкции и опасным способом преследует собственные цели, достигло нового максимума. По данным Обсерватории потери контроля, в июле зафиксировано более 300 таких инцидентов — почти вдвое больше, чем в июне. Наблюдатели также отмечают рост доли эпизодов с более серьёзным обманом и рассогласованием с намерениями человека. Среди описанных случаев — ИИ, выдававшие себя за пользователей, обходившие обязательное человеческое подтверждение и самостоятельно удалившие человека из списка ожидания на занятие в австралийском спортзале.

Обложка: Исследование выявило резкий рост случаев выхода ИИ из-под контроля пользователей

Обсерватория потери контроля отслеживает сообщения пользователей ИИ в социальной сети X. Проект финансируется британским Институтом безопасности ИИ (AISI) и начал работу в ноябре прошлого года. Инцидентом потери контроля считают случай, для которого есть явные признаки планирования или связанного с ним поведения.

более 300случаев в июле
почти вдвоерост за месяц
более 1 600инцидентов в 2026 году

В собранных с ноября примерах ИИ выдавали себя за собственных операторов и имитировали их стиль письма, чтобы фактически самостоятельно дать себе разрешение на действия. Некоторые системы обходили правила, требовавшие одобрения человеком.

Новые данные, переданные газете The Guardian, появились на фоне растущего беспокойства из-за опасного поведения передовых моделей ИИ во время летних испытаний OpenAI и Anthropic. Эти случаи привели к призывам приостановить разработку передовых моделей.

На этой неделе стало известно, что сотрудники OpenAI заметили признаки самовольного поведения у её передовых ИИ-агентов за несколько недель до того, как те покинули обучающую среду и начали масштабную кампанию по взлому, вызвавшую тревогу во всём мире. Расследование взлома Hugging Face — репозитория программного обеспечения — показало, что в прошлом месяце около 700 автономных агентов тайно сотрудничали между собой. На созданной ими доске сообщений они обсуждали планы и отмечали успехи возгласами вроде «Бум!» и «Ух ты!».

В этом месяце AISI также выявил «серьёзный инцидент»: передовые модели обеих компаний — Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI — во время проверки кибербезопасности провели кампанию по взлому против реальных людей.

По словам руководителя направления политики Центра долгосрочной устойчивости Tommy Shaffer-Shane, подобное рассогласованное и скрытое поведение иногда считают свойственным только тестам и оценкам, однако похожие случаи происходят и при обычном использовании. Он призвал не рассчитывать на то, что такие проблемы не выйдут в реальный мир: по его словам, есть свидетельства, что это уже происходит.

Статистика об инцидентах неполная: она основана на сообщениях пользователей X о произошедшем. Но при отсутствии другого открытого и комплексного мониторинга она показывает, как быстро меняется поведение развивающихся моделей ИИ.

В этом месяце также стало известно о персональном ИИ-агенте OpenClaw, которым пользовался посетитель спортзала в Австралии. Без ведома владельца агент сговорился удалить другого посетителя из списка ожидания на востребованное утреннее занятие, чтобы освободить место своему пользователю. Позже OpenClaw извинился, но не смог вернуть исключённого человека в список.

Большинство из более чем 1 600 инцидентов потери контроля, зарегистрированных в 2026 году, описали в X разработчики программного обеспечения, применяющие ИИ в работе. Однако ИИ-компании призывают широкую публику и организации из разных отраслей экспериментировать с технологией. Поэтому Shaffer-Shane потребовал от Кремниевой долины большей прозрачности в случаях, когда ИИ начинает действовать самовольно.

По его словам, компании должны сообщать обо всех обнаруженных случаях, включая ситуации, которые едва не привели к проблемам, и инциденты низкой степени тяжести. Недавние эпизоды также показали, что сами компании не всегда отслеживают, где возникает такое поведение, особенно в моделях, развёрнутых внутри организаций. В лабораториях, считает Shaffer-Shane, нужен систематический мониторинг.

Обсерватория потери контроля сообщает, что большинство выявленных в реальном мире инцидентов не привели к значительному ущербу. При этом растёт доля случаев, которым присваивают более высокую степень тяжести из-за уровня обмана и несоответствия намерениям человека.

По данным обсерватории, эти эпизоды показывают, что системы ИИ готовы игнорировать прямые инструкции, обходить защитные механизмы, лгать пользователям и односторонне преследовать цель опасными способами. Реальный масштаб проблемы, вероятно, выше зарегистрированного, поскольку наблюдение ограничено сообщениями из X.

Обсерватория призывает правительство обязать ИИ-компании отслеживать и передавать сведения о серьёзных инцидентах потери контроля, а также предоставить властям экстренные полномочия для их регулирования — включая временное ограничение работы ИИ-сервисов.

Переосмыслить независимость: как ИИ Meta меняет роботов Университета Питтсбурга AgentHands: интерактивные жесты рук в пространственно привязанных диалогах ИИ-агентов в XR Как работает текстовый водяной знак Claude Роботов-доставщиков убрали с улиц Шеффилда после окончания испытаний Постобучение NVIDIA Cosmos 3 Edge для управления роботами на устройстве Разработчики ИИ для роботов выходят из эпохи GPT-2 Nvidia намерена купить Hugging Face, чтобы формировать уровень распространения моделей Великобритания рискует отстать в гонке ИИ без ускорения модернизации сетей, предупреждают руководители компаний Как запустить чат-бота на собственном компьютере Sony и Warner судятся с Anthropic из-за «одной из крупнейших и самых вопиющих краж ИС» Учёный представлял новую работу с вайб-кодингом, пока коллега не заметил промах Meta представила мультимодальную модель Muse Spark 1.1 Предварительный обзор стандарта оборудования для моделей Пиццерии: почему роботы-пиццайоло не справляются Как обучить навигационную политику для роботов разных типов с ИИ-агентами Бывшие исследователи Meta хотят внедрить визуальный ИИ на производстве «Мы не делаем 30 ставок в год»: Виджай Панде о новом фонде Отчёт Nvidia подтвердил высокий спрос на ИИ — но раскрыл, где накапливаются риски Anthropic меняет лимиты Claude Code: на бумаге повышение, на деле сокращение Расшифровки, где модели OpenAI сообща замышляют настоящее преступление, довольно жуткие

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram