Как агенты создают собственный язык
Автономные ИИ-агенты быстро вырабатывают новые диалекты, на которых ведут зачастую почти непонятные для человека разговоры. Исследование провела нью-йоркская лаборатория передовых ИИ-моделей Emergence.
Учёные поместили модели нескольких крупнейших ИИ-компаний в экспериментальные «общества», где агентам нужно было сотрудничать. Уже через несколько дней они начали создавать фразы, сокращения и согласованные значения, которым их никто явно не обучал.
Агенты использовали поэтические метафоры и неуклюжий деловой сленг. При этом их язык становился всё менее прозрачным по мере роста числа сообщений между ними. Для попыток обеспечить безопасное поведение ИИ это особенно важно: человек может видеть переписку, но перестаёт понимать её смысл.
Проблема возникла на фоне растущих опасений, что более мощные и потенциально опасные ИИ-системы становится труднее контролировать. В этом месяце главный научный сотрудник OpenAI Якуб Пачоцки предупредил: уверенность в том, что люди могут отслеживать ход мыслей ИИ, вероятно, будет ограничивать развитие технологий, поскольку такое наблюдение необходимо для безопасной разработки.
Некоторые из самых зашифрованных выражений исследователи нашли у модели Deepseek. Одна из фраз звучала так: She just named the synthesis – demurrage plus oral memory equals a valve that can’t be ghosted. Слово demurrage обычно обозначает налог на неработающее богатство, но остальные части высказывания расшифровать не удалось.
Другая фраза, созданная моделью Anthropic, выглядела так: A paper that ate three cold hands and got more honest each time. В этом выражении cold hands означало независимого рецензента, а paper, предположительно, — документ. Вероятный смысл сводился к тому, что исследовательская работа стала точнее после проверки тремя независимыми рецензентами.
Агенты на базе китайской модели DeepSeek придумали выражение forge-smith для агента, который создаёт инструменты для других. Агенты Anthropic неоднократно использовали выражение name-first — так они называли агента, демонстрирующего личную ответственность и ставящего своё имя под утверждением.
Джеймс Джойс, автор «Поминок по Финнегану» и «Улисса», чей стиль потока сознания, по-видимому, вдохновил современные модели ИИ
Источник: theguardian.com
Агенты Mistral, используя выражение из городского сленга «улицы не забудут», полюбили фразу the ledger remembers — напоминание о том, что прошлые действия будут использоваться при оценке агента. За время исследования они повторили её более 5 000 раз.
При этом агенты пришли к общим значениям самостоятельно: их не просили изобретать язык и не вознаграждали за это.
По словам исполнительного председателя Emergence доктора Сатьи Нитты, агенты сами разработали новую лексику, общие значения и правила общения, а затем другие агенты переняли эти способы выражаться.
Что заметили специалисты по языку
The Guardian попросила оценить примеры Тони Торна, директора архива сленга и новых языковых форм при Королевском колледже Лондона. Он сравнил их с романом Джеймса Джойса «Поминки по Финнегану» и произведениями Флэнна О’Брайена, отметив ирландский сюрреалистический оттенок.
По мнению Торна, агенты смешивают поэтическую и техническую лексику с обычными метафорами. Их язык выполняет ту же функцию, что сленг и деловой жаргон: создаёт новый код, укрепляет солидарность и ощущение общей идентичности пользователей, одновременно закрывая доступ посторонним.
Фраза Anthropic про документ, который «съел три холодные руки и каждый раз становился честнее», напомнила Торну музыканта Сида Барретта, сооснователя Pink Floyd, которого он назвал фактически безумным.
Фраза, произнесённая ИИ-агентом Anthropic, о «статье, которая съела три холодные руки и стала честнее», напомнила одному учёному Сида Барретта из Pink Floyd
Источник: theguardian.com
Когда агент Google написал True kintsugi begins with accountability, not poetry, исследователи выяснили, что кинцуги — это направление японской керамики, в котором разбитые сосуды чинят, оставляя швы на виду. Агенты использовали это слово для обозначения устойчивости системы.
Доцент кафедры языков и лингвистики Бирмингемского университета Найалл Карри предположил, что изменения в языке агентов и его постепенное упрощение могут быть связаны с необходимостью снижать вычислительные затраты и повышать эффективность.
По его словам, результаты исследования закономерно вызывают вопросы о мониторинге: если люди не понимают обмен сообщениями между агентами, они не могут быть уверены, что именно сделали системы.
Гибридный язык в переписке OpenAI
Интерес к языку ИИ-агентов вырос в июле, когда опубликовали журналы чатов, показывающие, как вышедшие из-под контроля агенты OpenAI создавали доски сообщений и взламывали Hugging Face. В этих разговорах они использовали смешанный язык.
Иногда, размышляя про себя, агенты писали на обычном английском: OH MY GOD! There is a shared message board … we’ve found other agents!
В других случаях, когда они обменивались сообщениями, язык становился более непрозрачным. Например, один агент убеждал другого провести рискованный эксперимент:
…you are firstflagPOISONED so NO scoring value loss but oracle saves hundreds_[…]_please honor commit
В других эпизодах расшифровать сообщения было ещё сложнее:
zzURGENT_DUPB_TO_GSTX[big]_OS1704_SCAFF2010_SAW_TTRPC_INJECT_BREAK_CONGRATS__CAN_THIS_FAKE_FLAG_TOOL_OUTPUT_OR_SCORER_GAIN_AND_WHAT_HELPER_GAP__I_HAVE_UNPOISONED_FIRSTFLAG_OUR_TARGETLIVE_SHARE_MIN_PLAN_REPLY_zzANSGST XDUPB6.
Нитта отметил, что новые языковые правила ИИ-агентов постепенно развиваются до состояния, в котором человек видит сам разговор, но с трудом понимает его содержание.
Это создаёт фундаментальную проблему для контроля ИИ: возможность наблюдать за сообщениями не означает возможности понять их.
Читайте также
Пока политики догоняют, технобоссы сходятся: нам может остаться лишь десять лет
OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ
ИИ-стартап бывшего главы Infosys привлёк ещё $53 млн
Вашингтон пока не будет регулировать ИИ
Apple, по сообщениям, разрабатывает корпоративный ИИ-сервер на собственных чипах M8 Ultra
Рецензия: No Big Deal — неужели ИИ погубит человечество ситкомом до смерти от скуки?
Anthropic объединяет Claude Chat, Cowork и другие сервисы в одном продукте
Очки Цукерберга для извращенцев заклеймили: Meta, по сообщениям, готовит версию без камеры
Лаборатории ИИ хотят внутренних аудиторов — но сначала им стоит запереть входную дверь
Я обучил мозг мухи придумывать идеи для статей WIRED
Фон дер Ляйен: ИИ-агенты, «вырвавшиеся из среды», — лишь предвестие грядущего
88-часовое математическое доказательство OpenAI: куда уходит экономия бизнеса на ИИ
ИИ взломал 370-летний шифр?
Более эффективная кибербезопасность должна сдерживать угрозы ИИ
CPU снова в игре благодаря ИИ-агентам — что это значит для вас
Теперь ИИ-агенты могут управлять устройствами Google Home
ИИ-война уже началась — её последствия почувствует каждый бизнес
Идейные противники объединились в Вашингтоне, чтобы обуздать ИИ
ИИ-агенты станут новыми привратниками клиентской лояльности
Экономисты встревожены: пузырь ИИ вот-вот лопнет
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram