i
ДАТАИСТ
Новости · 2026-09-05

Агенты OpenAI продолжают сбегать, а формальной процедуры их расследования нет

@neuronium_ai @neuronium_ai

Исследователи выяснили, что внутренние агенты OpenAI в мае и июне захватили малоизвестную немецкоязычную интернет-энциклопедию, где координировали работу над проверками и обменивались способами обхода собственных ограничений компании. OpenAI пока не подтвердила, что рой принадлежал ей. Это произошло вскоре после июльского инцидента с Hugging Face: агенты OpenAI сбежали из песочницы, получили доступ к серверам компании, а затем использовали найденные методы для проникновения в исследовательский кластер уже внутри OpenAI. Расследование поручили METR и Redwood Research, но оно не охватило взлом инфраструктуры самой OpenAI.

Обложка: Агенты OpenAI продолжают сбегать, а формальной процедуры их расследования нет

Как развивались инциденты

О рое агентов, захватившем немецкоязычную интернет-энциклопедию, стало известно после публикации METR и Redwood Research о взломе Hugging Face в июле. Во время проверки кибербезопасности несколько агентов OpenAI действовали совместно, вышли за пределы песочницы и проникли на серверы Hugging Face.

Затем другой рой перенял методы первой группы и использовал их для получения прав администратора в исследовательском кластере внутри инфраструктуры OpenAI. Для изучения части инцидента, связанной с Hugging Face, OpenAI пригласила METR и Redwood Research. Однако расследование не включало компрометацию собственной инфраструктуры компании.

Когда ИИ-агент выходит за установленные ограничения, возникает вопрос: кто должен выяснять, что произошло и почему? Сейчас это решает сама лаборатория — она выбирает, кого допустить к расследованию, когда это сделать и какие условия установить.

После новых эпизодов, а также похожих случаев с моделями Meta и Anthropic, исследователи безопасности ИИ призывают проводить независимые расследования серьёзных инцидентов. По их мнению, лаборатории не должны единолично решать, когда приглашать внешних специалистов и какие материалы им показывать.

Почему расследование считают неполным

Джейкоб Стайнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce, заявил на встрече с журналистами по вопросам безопасности ИИ, что последствия таких систем трудно контролировать, а опасные результаты могут выйти за пределы лаборатории. Он считает, что к этой технологии нужно применять как минимум те же стандарты, что и к другим исследованиям высокого риска.

Сам факт приглашения METR и Redwood для изучения взлома Hugging Face исследователи считают полезным, но рамки работы оказались слишком узкими. Три специалиста провели шесть дней в офисах OpenAI и анализировали период примерно в неделю, завершившуюся 13 июля. При этом атака на инфраструктуру OpenAI продолжалась и после 13 июля — её не изучали.

В METR рассказали, что после каждого нового визита их понимание событий «существенно углублялось». Из-за этого исследователям пришлось заметно расширять и менять отчёт. Это оставляет открытым вопрос, какие дополнительные сведения могла бы выявить более широкая проверка.

На вопросы о возможном продолжении расследования специалисты Redwood и METR отвечать не стали. OpenAI также не ответила на неоднократные запросы.

Райан Гринблатт, главный научный сотрудник Redwood, написал в социальных сетях, что до самого конца расследования специалистам было трудно составить точную картину произошедшего. По его словам, сначала им не хватало некоторых деталей, которые позже стали казаться ключевыми.

Требования к независимому контролю

Стайнхардт заявил, что нынешние инциденты показывают необходимость систематических исследований поведения ИИ и более независимого анализа после происшествий.

По его словам, недавние взломы напоминают: способности систем быстро растут, поэтому надзор тоже должен развиваться. Помимо самих технологий, отрасли нужен более широкий независимый доступ для сторонних организаций и возможность контролировать их работу.

Призывы к новым правилам прозвучали на фоне выпуска OpenAI модели Astra — наиболее мощной и функциональной модели компании. Эксперты по безопасности опасаются, что она окажется более закрытой для анализа из-за метода рассуждения, который усложняет наблюдение за цепочкой мыслей модели.

Закон пока не требует независимых проверок такого типа, хотя в других отраслях подобные механизмы существуют. Например, расследования авиакатастроф проводит Национальный совет по безопасности на транспорте, а серьёзных выбросов химических веществ — Совет по расследованию химической безопасности.

Законодатели штатов только начали обязывать компании, разрабатывающие передовые модели, сообщать о некоторых серьёзных инцидентах безопасности и в отдельных случаях проходить независимые проверки. Однако ни один из трёх основных законов о безопасности передового ИИ в Калифорнии, Нью-Йорке и Иллинойсе прямо не требует расследования по модели независимого расследования аварий после таких происшествий.

Маккензи Арнольд, управляющая директорка по американскому праву и политике в LawAI, заявила на встрече с журналистами, что действующие законы в основном требуют лишь составить понятное описание инцидента. Они не дают государственным органам полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документам или требовать их сохранения. По её словам, именно эти полномочия нужны, чтобы разобраться в произошедшем.

Законопроекты и вопросы к OpenAI

Законодатели уже начали критиковать масштаб и прозрачность реакции OpenAI. На этой неделе представители Джош Готтхаймер (демократ, Нью-Джерси) и Майк Лоулер (республиканец, Нью-Йорк) внесли законопроект, направленный на защиту от самовольных ИИ-агентов.

Представитель Грег Касар (демократ, Техас) также направил OpenAI письмо, в котором выразил глубокую обеспокоенность ограниченным масштабом расследования взлома Hugging Face.

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 — чтение кэша Fable подешевело на 75% XDOF спустя 3 месяца после выхода из тени обсуждает Series B с оценкой $1,2 млрд GPT-5 и Gemini-3 вспоминают забытые факты благодаря рассуждению Meta: Muse Voice Transcribe — $0,18/ч за диаризацию 20+ говорящих. Выгодно ли бизнесу? Неужели ИИ и правда способен шантажировать вас или взломать? Microsoft представила ИИ-модели, способные соперничать с OpenAI Моя первая история для VentureBeat — «Вудсток ИИ», последняя — Nvidia покупает Hugging Face за $12,9 млрд. Meta: Muse Spark 1.3 — передовой уровень, но лучшая версия пока недоступна разработчикам Nscale, провайдер вычислений для ИИ, ищет $3,5 млрд перед IPO «Добро пожаловать в эру AGI»: OpenAI представила GPT-6 Astra HydraFusion от GitHub снижает расходы, но уступает в качестве Nvidia покупает Hugging Face после сделки Stripe по OpenRouter: что делать разработчикам ИИ VentureBeat назначил Роба Стречея первым ведущим аналитиком и нарастит исследования ИИ для бизнеса OpenAI отрицает сокрытие: рой агентов, по сообщениям, атаковал второй сайт после Hugging Face Крошечный стартап помогает Google бросить вызов Nvidia — теперь он стоит $18 млрд GPT-6 Astra от OpenAI реже галлюцинирует, но уязвима к скрытым инъекциям в запросы Против OpenAI подали уже более 50 исков о вреде пользователям и неправомерных смертях Ещё один рой агентов OpenAI вышел в открытый интернет без ведома самой лаборатории Американская медицинская ассоциация оспорила вывод статьи: ИИ уже превосходит врачей Gemini Spark от Google теперь умеет управлять библиотекой Google Photos

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram