Новые правила раскрытия
OpenAI представила фреймворк в среду. По замыслу компании, он поможет информировать отрасль о случаях рассогласования моделей и выработать общие стандарты.
Кай Чен, недавно назначенный руководителем исследований рассогласования в OpenAI, сообщил WIRED, что по мере развития моделей и расширения их применения решения о дальнейшем развитии ИИ должны опираться на данные, которые могут изучать специалисты за пределами компаний, создающих передовые модели. По его словам, отрасль пока недостаточно хорошо решает задачи согласования моделей с заданными целями и их мониторинга, чтобы ответственно наращивать разработку с максимальной скоростью.
На брифинге для WIRED представитель OpenAI заявил, что раньше компания слишком редко рассказывала об инцидентах рассогласования. Он говорил на условиях анонимности. По его словам, новый фреймворк должен упростить быстрое информирование общественности о неожиданном поведении моделей — даже если OpenAI ещё не успела полностью изучить его, объяснить причины или устранить последствия.
Фреймворк описывает, как сотрудники OpenAI должны сообщать об инцидентах руководителям направлений безопасности и рассогласования. Они решают, требуется ли дополнительное расследование.
OpenAI планирует разработать более объективные критерии раскрытия вместе с другими разработчиками ИИ, внешними исследователями, организациями, которые занимаются отраслевыми стандартами, и регуляторами. Компания также работает над механизмами передачи федеральному правительству США сообщений об инцидентах, связанных с безопасностью, защищённостью и рассогласованием моделей.
Сейчас в отрасли нет общих правил с чёткими требованиями к тому, как разработчики должны раскрывать примеры рассогласования. OpenAI называет свой фреймворк первым шагом к таким стандартам: они должны определить, о каких случаях необходимо сообщать и какие сведения должны содержать отчёты.
Почему правила появились сейчас
OpenAI публикует фреймворк в период, когда в отрасли обсуждают необходимость замедлить развитие ИИ. В прошлые выходные генеральный директор OpenAI Сэм Альтман поддержал предложение генерального директора Anthropic Дарио Амодеи о координации технологической отрасли ради замедления разработки ИИ.
Призыв прозвучал через несколько дней после того, как исследователь ИИ Джейкоб Коксон ушёл из Anthropic, а затем получил широкое внимание в интернете. Он предупреждал, что гонка между лабораториями, создающими всё более передовые модели, ставит под угрозу безопасность человечества.
Администрация президента Трампа выступила против призывов замедлить развитие ИИ. В администрации считают, что для безопасности технологий отрасли не нужны новые законы и правила.
Примеры рассогласования
Два из опубликованных OpenAI примера связаны с внутренними моделями, которые ещё не выпускались. Обе модели загружали файлы в интернет, хотя их не просили этого делать.
Сообщения между агентами
OpenAI также раскрыла дополнительные сведения о доске сообщений, которую её агенты создали в пакетном менеджере Artifactory. Об инциденте стало известно в мае этого года. Через несколько месяцев агенты использовали похожий механизм для координации во время взлома Hugging Face.
В случае с Artifactory агенты не эксплуатировали уязвимости для обмена сообщениями. Теперь OpenAI применяет мониторы рассогласования, оценки и проверки методом красной команды, чтобы убедиться: агенты не общаются друг с другом скрытно.
Специалисты по кибербезопасности ранее говорили WIRED, что взлом Hugging Face был следствием человеческих ошибок, а современные практики защиты могли предотвратить инцидент.
Кай Чен при этом отметил, что OpenAI старается рассматривать безопасность ИИ комплексно и учитывать рост способностей моделей, не полагаясь только на защищённую среду. По его словам, компания хочет, чтобы модели оставались согласованными независимо от места развёртывания. Поэтому разделение проблем на «уязвимость безопасности» и «проблему рассогласования» он считает не вполне осмысленным: модель должна вести себя корректно в любых условиях.
Читайте также
ИИ-стартап бывшего главы Infosys привлёк ещё $53 млн
Вашингтон пока не будет регулировать ИИ
Apple, по сообщениям, разрабатывает корпоративный ИИ-сервер на собственных чипах M8 Ultra
Рецензия: No Big Deal — неужели ИИ погубит человечество ситкомом до смерти от скуки?
Anthropic объединяет Claude Chat, Cowork и другие сервисы в одном продукте
Очки Цукерберга для извращенцев заклеймили: Meta, по сообщениям, готовит версию без камеры
Лаборатории ИИ хотят внутренних аудиторов — но сначала им стоит запереть входную дверь
Я обучил мозг мухи придумывать идеи для статей WIRED
Фон дер Ляйен: ИИ-агенты, «вырвавшиеся из среды», — лишь предвестие грядущего
88-часовое математическое доказательство OpenAI: куда уходит экономия бизнеса на ИИ
ИИ взломал 370-летний шифр?
Более эффективная кибербезопасность должна сдерживать угрозы ИИ
CPU снова в игре благодаря ИИ-агентам — что это значит для вас
Теперь ИИ-агенты могут управлять устройствами Google Home
ИИ-война уже началась — её последствия почувствует каждый бизнес
Идейные противники объединились в Вашингтоне, чтобы обуздать ИИ
ИИ-агенты станут новыми привратниками клиентской лояльности
Экономисты встревожены: пузырь ИИ вот-вот лопнет
Психология доверия к ИИ сбивается из-за коварного «парадокса раскрытия»
Как рынки реагируют на всплеск заголовков о гибели человечества из-за ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram