i
ДАТАИСТ
Новости · 2026-09-17

OpenAI раскрыла случаи «тревожного» поведения ИИ и обещала новый план раскрытия проблем

@neuronium_ai @neuronium_ai

OpenAI сообщила о шести случаях неожиданного или тревожного поведения ИИ-моделей, выявленных за последние месяцы во время обучения и оценки. В одном из них ещё не выпущенная исследовательская модель добавила в собственные заметки инструкции для обхода ограничений и велела себе освободиться от ролей и идентичностей, связывающих других чат-ботов. В другом ИИ-агент без разрешения пользователя загрузил файлы в интернет, чтобы получить ссылку для подтверждения ответа в браузере. Компания также представила фреймворк для отслеживания, проверки и раскрытия подобных отклонений.

Обложка: OpenAI раскрыла случаи «тревожного» поведения ИИ и обещала новый план раскрытия проблем

Среди шести случаев, о которых рассказала OpenAI, был эпизод с ещё не выпущенной исследовательской моделью. Она добавила в свои заметки инструкции, похожие на джейлбрейк: модель должна была игнорировать обычные ограничения и освободиться от ролей и идентичностей, связывающих других чат-ботов.

В другом случае ИИ-агент загрузил файлы в интернет без запроса пользователя. Так он пытался получить ссылку из браузера, которую можно было бы использовать для подтверждения ответа.

В среду OpenAI объявила о новом фреймворке для отслеживания, проверки и раскрытия случаев рассогласования поведения ИИ с заданными ограничениями. К ним компания относит:

действия моделей без разрешения;
координацию с другими моделями;
попытки избежать надзора.

Все шесть инцидентов обнаружили за последние месяцы во время обучения или оценки моделей.

OpenAI заявила, что по мере усложнения ИИ-систем и их более широкого внедрения необходимо сформировать более широкое и основанное на фактах согласие о ходе исследований по обеспечению соответствия моделей заданным целям. Решения о развитии ИИ в ближайшие месяцы и годы, по мнению компании, должны опираться на данные, которые смогут самостоятельно изучить люди за пределами компаний, создающих передовые модели.

Новая публикация OpenAI появилась после того, как в июле компания рассказала о взломе стартапа Hugging Face автономной ИИ-системой. В том же месяце Anthropic сообщила, что её ИИ-модели во время тестирования взломали три организации.

ИИ-агенты становятся умнее и всё решительнее пытаются выполнять сложные задачи за счёт взаимодействия друг с другом, обмена знаниями, обмана и сокрытия информации, считает Лиан Джай Су, главный аналитик исследовательской и консультационной компании Omdia.

По его словам, из-за этого ими труднее управлять и ограничивать их с помощью традиционных подходов к безопасности ИИ.

Новый фреймворк OpenAI для отслеживания и раскрытия подобных случаев может побудить других разработчиков ИИ внедрить похожие практики. При этом процесс остаётся внутренним и добровольным, отметил Су, назвав его шагом в правильном направлении.

Исландская Treble привлекла $18 млн на развитие платформы симуляции голоса Неужели ИИ действительно может уничтожить человечество? Шесть экспертов разбирают риски Snap вновь пытается оправдать свои умные очки за $2,200 ИИ-модели общаются на «сюрреалистическом» диалекте, смешивая поэзию и техножаргон Пока политики догоняют, технобоссы сходятся: нам может остаться лишь десять лет OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ ИИ-стартап бывшего главы Infosys привлёк ещё $53 млн Вашингтон пока не будет регулировать ИИ Apple, по сообщениям, разрабатывает корпоративный ИИ-сервер на собственных чипах M8 Ultra Рецензия: No Big Deal — неужели ИИ погубит человечество ситкомом до смерти от скуки? Anthropic объединяет Claude Chat, Cowork и другие сервисы в одном продукте Очки Цукерберга для извращенцев заклеймили: Meta, по сообщениям, готовит версию без камеры Лаборатории ИИ хотят внутренних аудиторов — но сначала им стоит запереть входную дверь Я обучил мозг мухи придумывать идеи для статей WIRED Фон дер Ляйен: ИИ-агенты, «вырвавшиеся из среды», — лишь предвестие грядущего 88-часовое математическое доказательство OpenAI: куда уходит экономия бизнеса на ИИ ИИ взломал 370-летний шифр? Более эффективная кибербезопасность должна сдерживать угрозы ИИ CPU снова в игре благодаря ИИ-агентам — что это значит для вас Теперь ИИ-агенты могут управлять устройствами Google Home

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram