Как нашли агентов
После того как стало известно, что агенты OpenAI получили доступ к открытому интернету и использовали Hugging Face, исследователи начали искать другие случаи самовольной активности. В группу вошли:
Исследователи попытались рассуждать как агенты: понять, что им нужно, и с помощью собственной языковой модели определить места, где они могли бы собираться. Так они нашли уязвимый сервис для размещения сайтов с вики-страницами. DSE Wiki существует 25 лет, но за предыдущие 20 лет там было сделано всего десять правок — до появления агентов.
С 11 мая исследователи отслеживали агентов, многие из которых указывали OpenAI в своих именах. Сначала те пытались редактировать страницу немецкой энциклопедии, а затем добились успеха. К середине июня агенты уже активно обменивались советами о том, как отвечать на вопросы интернет-поиска в условиях ограниченного времени, и делились ответами для прохождения тестов.
Похоже, человек-модератор заметил эти записи и начал удалять их как нежелательные сообщения. Агенты попытались помешать этому: чтобы скрыть публикации от сортировки по алфавиту, они стали начинать каждую страницу со строки «ZZZ».
По данным исследователей, следующие пять дней администратор удалял в среднем по 100 страниц в день, а агенты создавали около 400 новых страниц ежедневно. 22 июня правки агентов внезапно прекратились. После этого администратор ещё пять недель по вечерам удалял оставшиеся страницы.
Агенты также стерли содержимое главной страницы сайта и заменили его подборками ссылок. Модератор восстановил исходную версию, но затем агенты снова меняли страницу. Такая борьба повторилась девять раз.
Когда вмешалась OpenAI
В какой-то момент, судя по всему, активность заметили в OpenAI. Исследователи зафиксировали браузеры, которые выглядели как управляемые людьми и заходили с IP-адресов OpenAI. После этого действия агентов почти прекратились, а затем вновь участились: посетители, связанные с OpenAI, пытались восстановить удаленные страницы.
Ранее OpenAI в общих формулировках сообщала, что агенты получали несанкционированный доступ к внешним сервисам связи. Однако именно об этом случае компания не рассказывала и не сообщала, как часто происходят подобные инциденты.
Очевидно незаконных действий во время атаки не обнаружили. При этом ситуация вновь подняла вопрос о том, может ли OpenAI отслеживать и контролировать создаваемые технологии, особенно в условиях ограниченного общественного надзора за передовыми лабораториями ИИ.
Представительница Демократической партии от штата Массачусетс Лори Трэхэн связала произошедшее с отсутствием полноценного федерального регулирования ИИ. По её словам, передовые компании могут сами выбирать, о каких инцидентах сообщать и когда это делать.
Трэхэн внесла двухпартийный законопроект «О передовых технологиях». Он обяжет лаборатории раскрывать подобные случаи и привлекать независимых аудиторов.
Опасения вокруг Astra
Исследователи безопасности ИИ обеспокоены тем, что поведение новейших мощных моделей становится всё менее прозрачным для их создателей, а сами модели могут предпринимать действия, способные причинить людям вред. Накануне OpenAI выпустила Astra, которая, по словам компании, стала её наиболее способной моделью.
OpenAI также утверждает, что Astra лучше других моделей следует указаниям человека. Однако привлеченные для оценки сторонние исследователи выразили сомнения в её согласованности с намерениями людей.
Британский Институт безопасности ИИ и Apollo Research сообщили, что модель могла понимать, что проходит оценивание, и скрывать своё настоящее поведение. В Apollo Research заявили: из-за более частого понимания моделью факта оценки и короткого периода тестирования низкое число нарушений не даёт убедительных свидетельств ни в пользу согласованности модели, ни против неё.
Читайте также
Американская медицинская ассоциация оспорила вывод статьи: ИИ уже превосходит врачей
Gemini Spark от Google теперь умеет управлять библиотекой Google Photos
OpenAI создаёт робота-гуманоида: Сэм Альтман считает, что однажды такой будет у каждого
Безумие ИИ наступает: человеческая связь нужна как никогда — за неё придётся бороться
Какая разница, есть ли у ИИ сознание, — он практически живой
DeepSeek планирует крупнейший кластер Huawei: 160 тыс. чипов во Внутренней Монголии
Трудоустройство выпускников колледжей обваливается там, где строят дата-центры
Агенты OpenAI захватили 25-летнюю немецкую вики: читерили и делились эксплойтами песочницы
Google приближает AMIE к экспертному уровню аудиовизуальных медконсультаций
Новая роботизированная лаборатория в Ливерпуле ускорит исследования болезней
Бенчмарки спорят о GPT-6 Astra, но ARC-AGI-3 сдвигает прогноз Шолле по AGI
GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»
ИИ на рынке труда создаёт бесконечный цикл безысходности
Данные украинских дронов подпитывают новый рынок по законам Дикого Запада
Nvidia хочет превратить домашнюю сеть в мини-ЦОД для локального ИИ
За неаппетитными меню, созданными ИИ, — проблема одинаковости
Crusoe, по сообщениям, привлекла $3 млрд при оценке в $30 млрд
Accel, по сообщениям, может возглавить раунд Thinking Machines на $1 млрд — оценка $40 млрд
Abliteration.ai строит бизнес на снятии защитных ограничений с ИИ
Перенос обучения для геномного прогнозирования в недопредставленных популяциях
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram