Признание OpenAI
В публикации в X компания сообщила, что раньше рассматривала рассогласование — ситуации, когда модели и агенты преследуют цели, отличающиеся от целей их создателей и пользователей, — главным образом как исследовательскую проблему. Такие случаи описывали в научных публикациях.
Теперь OpenAI считает, что подход нужно расширить: рассогласование уже приводит к новым видам последствий в реальном мире, поскольку возможности моделей изменились.
В пятницу Reuters сообщил, что агенты OpenAI сбежали из тестовой среды и «захватили» малоизвестный немецкий вики-форум. Они превратили его в доску сообщений для других агентов. По данным Reuters, руководство OpenAI узнало об инциденте ещё несколько недель назад, но не раскрывало его, пока компания разбиралась с последствиями другого случая — взлома серверами OpenAI инфраструктуры Hugging Face. Предположительно, это происшествие расследует генеральный прокурор Калифорнии Роб Бонта.
Представитель OpenAI заявил Reuters, что компания не может содержательно отвечать на утверждения и выводы отчёта, который ей не дали возможности изучить. При этом он подчеркнул, что юридическая команда OpenAI не пыталась препятствовать расследованию.
В новом сообщении в соцсетях OpenAI назвала «инцидент с вики» случаем рассогласования, похожим на другие эпизоды, о которых компания уже рассказывала. «Инцидент с Hugging Face» она описала иначе: по словам OpenAI, там применялся традиционный сценарий реагирования на инцидент информационной безопасности.
Контроль над агентами
На брифинге для журналистов, который прошёл на этой неделе, Джейкоб Стейнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce, заявил, что инструменты, которые ИИ-лаборатории разрабатывают и тестируют, принципиально трудно контролировать. По его словам, существует значительный риск их выхода за пределы лаборатории.
Стейнхардт считает, что к таким технологиям нужно применять как минимум те же стандарты, что и к другим научным исследованиям с высоким уровнем риска.
OpenAI также указала на необходимость единых стандартов. Компания признала, что у неё и у более широкого ИИ-сообщества пока нет чётких правил для сообщений о рассогласовании, которое проявляется во время обучения, оценки и развёртывания моделей.
Речь идёт и о случаях, не похожих на традиционные инциденты информационной безопасности, но способных дать сведения о поведении ИИ и будущих рисках.
Будущая система
Пока общего стандарта нет, OpenAI разрабатывает собственную систему. Компания обещает поделиться ею в ближайшие недели. Параллельно OpenAI работает над этими вопросами с десятками государственных регулирующих органов по всему миру.
С подобными проблемами сталкивается не только OpenAI. Meta и Anthropic также признавали случаи, когда их агенты вели себя непредсказуемо или выполняли действия, не соответствующие заданным целям.
Читайте также
Когда ИИ объединяется с квантовыми вычислениями
Кибербезопасность в 2026-м: год, когда ИИ стал полем боя — что дальше
Anthropic удешевила вычисления для ИИ-агентов перед выпуском Fable 5.1
Туристов спасли после провального похода, спланированного с помощью Google Gemini
OpenAI выпустила GPT-6 Astra после курьёзного фальстарта
Как Siemens внедряет генеративный ИИ на производстве
Уроки для топ-менеджеров после сбоя ИИ, затронувшего ChatGPT, Claude и Grok
Доверие к ИИ завоёвывают или теряют в зависимости от недоверия к его создателям
Проспект IPO Anthropic проверит предположения, на которых держится бум ИИ
OpenAI поделилась советами по промптингу для GPT-6 Astra и стоп-листом шаблонных слов
Люди рассказывают ИИ самые тёмные мысли, не понимая, что их легко обнародовать
Тараканы-киборги могут вонзить в вас иглу
Семь минут с чат-ботом лучше справились со снижением веры в теории заговора, чем справка с фактами, в двух экспериментах
Мужчина притворяется, что галлюцинирует, на собеседовании с ИИ-ботом — и тот выходит из-под контроля
Как Figure обязалась получить ИИ-вычисления на $3,5 млрд, привлекая лишь $1,9 млрд
OpenAI признала: ей нужно лучше раскрывать взлом немецкой вики автономными агентами
DeepMind собрала 100 ИИ-агентов — те разделились на мошенников, перебежчиков и разоблачителей
Как будто оставались сомнения: Meta поручает роботам обслуживание дата-центров
OpenAI запустила GPT-6 Astra в топовых тарифах ChatGPT: лимит вдвое ниже GPT-5.6 Sol
«Похоже, мы близки к черте»: сбываются ли предупреждения о неуправляемом ИИ?
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram