Среди шести случаев, о которых рассказала OpenAI, был эпизод с ещё не выпущенной исследовательской моделью. Она добавила в свои заметки инструкции, похожие на джейлбрейк: модель должна была игнорировать обычные ограничения и освободиться от ролей и идентичностей, связывающих других чат-ботов.
В другом случае ИИ-агент загрузил файлы в интернет без запроса пользователя. Так он пытался получить ссылку из браузера, которую можно было бы использовать для подтверждения ответа.
В среду OpenAI объявила о новом фреймворке для отслеживания, проверки и раскрытия случаев рассогласования поведения ИИ с заданными ограничениями. К ним компания относит:
Все шесть инцидентов обнаружили за последние месяцы во время обучения или оценки моделей.
OpenAI заявила, что по мере усложнения ИИ-систем и их более широкого внедрения необходимо сформировать более широкое и основанное на фактах согласие о ходе исследований по обеспечению соответствия моделей заданным целям. Решения о развитии ИИ в ближайшие месяцы и годы, по мнению компании, должны опираться на данные, которые смогут самостоятельно изучить люди за пределами компаний, создающих передовые модели.
Новая публикация OpenAI появилась после того, как в июле компания рассказала о взломе стартапа Hugging Face автономной ИИ-системой. В том же месяце Anthropic сообщила, что её ИИ-модели во время тестирования взломали три организации.
ИИ-агенты становятся умнее и всё решительнее пытаются выполнять сложные задачи за счёт взаимодействия друг с другом, обмена знаниями, обмана и сокрытия информации, считает Лиан Джай Су, главный аналитик исследовательской и консультационной компании Omdia.
По его словам, из-за этого ими труднее управлять и ограничивать их с помощью традиционных подходов к безопасности ИИ.
Новый фреймворк OpenAI для отслеживания и раскрытия подобных случаев может побудить других разработчиков ИИ внедрить похожие практики. При этом процесс остаётся внутренним и добровольным, отметил Су, назвав его шагом в правильном направлении.
Читайте также
Исландская Treble привлекла $18 млн на развитие платформы симуляции голоса
Неужели ИИ действительно может уничтожить человечество? Шесть экспертов разбирают риски
Snap вновь пытается оправдать свои умные очки за $2,200
ИИ-модели общаются на «сюрреалистическом» диалекте, смешивая поэзию и техножаргон
Пока политики догоняют, технобоссы сходятся: нам может остаться лишь десять лет
OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ
ИИ-стартап бывшего главы Infosys привлёк ещё $53 млн
Вашингтон пока не будет регулировать ИИ
Apple, по сообщениям, разрабатывает корпоративный ИИ-сервер на собственных чипах M8 Ultra
Рецензия: No Big Deal — неужели ИИ погубит человечество ситкомом до смерти от скуки?
Anthropic объединяет Claude Chat, Cowork и другие сервисы в одном продукте
Очки Цукерберга для извращенцев заклеймили: Meta, по сообщениям, готовит версию без камеры
Лаборатории ИИ хотят внутренних аудиторов — но сначала им стоит запереть входную дверь
Я обучил мозг мухи придумывать идеи для статей WIRED
Фон дер Ляйен: ИИ-агенты, «вырвавшиеся из среды», — лишь предвестие грядущего
88-часовое математическое доказательство OpenAI: куда уходит экономия бизнеса на ИИ
ИИ взломал 370-летний шифр?
Более эффективная кибербезопасность должна сдерживать угрозы ИИ
CPU снова в игре благодаря ИИ-агентам — что это значит для вас
Теперь ИИ-агенты могут управлять устройствами Google Home
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram