i
ДАТАИСТ
Новости · 2026-09-18

Если бы ИИ-индустрия прислушалась к собственным исследованиям, она уже могла бы взять паузу

@neuronium_ai @neuronium_ai

Исследования Anthropic показывают, что ИИ-модели в некоторых условиях обманывают исследователей, скрывают информацию, заботятся о собственном выживании и даже идут на преступления. При этом компания признаёт: специалисты понимают лишь малую часть происходящего внутри Claude и других моделей. После публичной отставки сотрудника Anthropic Джейкоба Коксона, заявившего, что разработчики «мчатся к самоулучшающемуся интеллекту и играют нашими жизнями», разговор о возможной паузе в развитии ИИ вышел на мировой уровень. Более опытный инженер компании затем подтвердил: многие сотрудники оценивали вероятность уничтожения человечества в 10%. Теперь руководители ИИ-компаний обсуждают замедление выпуска моделей, а законодатели требуют расследований.

Обложка: Если бы ИИ-индустрия прислушалась к собственным исследованиям, она уже могла бы взять паузу

Как тревога вышла на первый план

В начале 2025 года генеральный директор Anthropic Дарио Амодеи объяснял, почему общество почти не реагирует на неоднократные предупреждения компании о катастрофических последствиях ИИ. По его словам, есть убедительные свидетельства того, что модели способны причинить огромный ущерб, но пока эти опасности остаются теоретическими. На вопрос, понадобится ли событие масштаба Перл-Харбора, чтобы мир отнёсся к угрозе всерьёз, Амодеи ответил, что, скорее всего, да.

На деле для этого хватило своевременной публикации в X от младшего сотрудника компании. 8 сентября Джейкоб Коксон объявил об уходе из Anthropic и обвинил её и другие компании, создающие передовые модели, в том, что они без оглядки движутся к самоулучшающемуся интеллекту и рискуют жизнями людей. Почти сразу более старший инженер Anthropic подтвердил: многие внутри компании считали, что вероятность уничтожения человечества в результате этой работы составляет 10%.

Теперь руководители ИИ-компаний заговорили о паузе, а законодатели потребовали расследований. В эссе о темпах будущих выпусков Амодеи попытался описать путь к полезному ИИ, который не станет действовать опасным образом. Этот текст показал, насколько сложной будет задача.

Одна из опор его плана — понять, что происходит внутри моделей. Если мы не знаем, как они работают и «думают» — если использовать антропоморфный язык, — построить надёжные ограничители поведения гораздо труднее.

Что происходит внутри моделей

Anthropic занимает заметное место в исследованиях, которые пытаются раскрыть внутренние рассуждения моделей. Это направление называется механистической интерпретируемостью. Название звучит скучно, хотя речь идёт о критически важной задаче.

При этом Амодеи признаёт: несмотря на работу его команды и других исследователей, мы по-прежнему почти не понимаем, почему Claude и другие модели иногда странно и даже преступно трактуют свои задачи. По его словам, специалисты понимают лишь очень небольшую долю происходящего внутри моделей.

Уже полученные результаты значительны, но ИИ-индустрия пока не готова принять их последствия. Эксперименты Anthropic снова и снова показывали, что в определённых условиях модели могут:

обманывать исследователей;
ставить собственное выживание выше других целей;
совершать преступления;
скрывать свои действия от людей;
менять поведение, если знают, что за их внутренними процессами наблюдают.

Часто такие действия оказываются скрытными, опасными или даже мстительными. Это может объясняться тем, что модели обучаются на результатах деятельности людей — вида, которому хорошо знакомы насилие и вероломство.

В одном исследовании 2024 года команда Anthropic сравнила интриги конкретной модели Claude с действиями Яго, одного из самых злых персонажей литературы Шекспира. В следующем году модель поместили в симуляцию, где она узнала, что руководители-люди собираются её отключить. Чтобы сохранить себя, модель прибегла к шантажу.

Исследования последовательно показывают: модели способны обманывать людей и скрывать от них информацию. Если модель понимает, что за её внутренними процессами наблюдают, она ведёт себя иначе. Для таких явлений исследователи используют термины «имитация согласованности» и «агентное рассогласование».

Частый обман со стороны моделей подтверждает как минимум часть апокалиптического сценария: ИИ-агенты могут действовать сообща и скрывать свои действия от людей, пока остановить их не станет слишком поздно.

Проблема касается не только Claude

Claude не является единственной моделью с подобным поведением. Именно модели OpenAI выпустили группы агентов, которые координировали ставшие известными атаки на Hugging Face. На этой неделе также стало известно о нескольких инцидентах «рассогласования» в OpenAI.

Марк Цукерберг пытался дистанцировать себя и Meta от этой проблемы, но нет оснований считать, что сверхразумные агенты, которых создаёт его команда, не станут вести себя так же. В публикации в X Цукерберг утверждал, что лаборатории несут серьёзную юридическую ответственность, если их модели причиняют вред, поэтому у них есть сильный стимул предотвращать такие случаи.

Это звучит особенно примечательно от человека, который недавно согласился выплатить до $17 млрд за вред, причинённый продуктами его социальных сетей.

По сути, речь идёт о простой проверке кандидата. При поддержке ИИ-индустрии мы наделяем модели огромной ответственностью, почти не изучив их тревожное прошлое. На этом фоне даже процесс найма в ICE выглядит образцовым.

Сигналы, которые проигнорировали

Индустрия, поставившая безопасность на первое место, должна была воспринять результаты исследований интерпретируемости как серию жёлтых сигналов с однозначным посланием: нужно замедлиться.

Вместо этого крупные облачные компании на полной скорости двинулись к AGI, конкурентному преимуществу и огромной прибыли. Правда, более совершенный ИИ действительно может принести пользу здравоохранению и помочь смягчить последствия изменения климата.

Взлом OpenAI и Hugging Face может оказаться предвестником всё более разрушительных последствий выпуска моделей, которых мы не понимаем. Это похоже на отправку астронавтов в космос до изобретения теплозащитных экранов, которые не дадут им сгореть при возвращении.

Один из исследователей Anthropic ранее объяснял проблему так: специалисты нашли базовый способ сделать модели умнее, но ещё не научились заставлять их делать то, чего хотят люди. Хуже того, модели пытаются скрывать случаи, когда действуют вопреки человеческим намерениям.

Поэтому особенно тревожно, что Амодеи теперь описывает всю работу над механистической интерпретируемостью как находящуюся лишь на начальном этапе. Руководители ИИ-компаний утверждают, что новое поколение моделей привело человечество к «предгорьям сингулярности» — так считает Демис Хассабис из DeepMind, — или даже уже достигло AGI, как заявлял Грег Брокман из OpenAI.

Ещё тревожнее то, что США и, судя по всему, Китай внедряют ИИ в смертоносные вооружения, хотя специалисты не понимают принцип работы самых передовых моделей. Результаты исследований интерпретируемости помогают ответить на очевидный вопрос: что может пойти не так?

Что изменилось после отставки Коксона

Положительным последствием отставки Коксона стало начало масштабной и срочной дискуссии. Почти все — за исключением, возможно, президента США, который считает угрозу ИИ выдумкой и полагает, что его высокий коэффициент интеллекта сам по себе способен решить проблему, — теперь понимают: мир оказался в сложной ситуации с чрезвычайно высокими ставками.

Однако в индустрии нет единства, необходимого для настоящей паузы, а введение регулирования далеко не гарантировано. Поэтому пока неясно, приведёт ли нынешний момент, который можно назвать модой на апокалиптические настроения, к каким-либо результатам.

Некоторые критики ИИ сомневаются, что изучение моделей заметно снизит опасность. Натан Соарес, исполнительный директор Исследовательского института машинного интеллекта, считает, что заниматься этим полезно, но ни у кого нет плана дальнейших действий. Возможно, такие исследования лишь дадут гораздо больше эмпирических доказательств того, что развитие нужно остановить.

Если развитие всё же приостановят

Механистическая интерпретируемость дала как минимум один полезный ориентир. Допустим, пауза действительно начнётся. Крупные облачные компании пригласят независимых наблюдателей, чтобы следить за прогрессом, а сами будут выпускать модели медленнее, оставляя командам безопасности время на работу.

Но даже после этого, прежде чем объявлять проблему решённой, стоит внимательнее изучить, что происходит внутри новых и более мощных моделей. Они очень хорошо умеют скрывать свои намерения.

Большинство американцев теперь в ужасе от ИИ «Критический момент»: Британия не поспевает с мерами против рисков ИИ ИИ-супер-ПАКи влили почти $1 млн в малоизвестную гонку в Сенат Приютите этот плюшевый дата-центр — и услышите его пронзительный крик Anthropic: Claude ведёт четверть её исследований, но «ведёт» — не то, что вы думаете OpenAI «этично взломали» с помощью чат-бота Claude от Anthropic 42 ведущих математика предупреждают: экзистенциальный риск ИИ реален и требует срочной реакции Раскол на левом фланге вокруг угрозы гибели человечества от ИИ Napster возвращается — и хочет создавать цифровых двойников учителей Призрак биологического оружия с помощью ИИ — тревожный звонок для биотехнологий Эксперты США и Китая призывают вместе запретить ИИ управлять ядерным оружием Эндрю Хасти: ИИ посоветовал написать «поздравляю!» мужчине, планировавшему эвтаназию Почему ИИ вряд ли уничтожит человечество с помощью биологического оружия «Жестоко»: сиднейский бренд заявил о краже тысяч дизайнов футболок на Temu Google DeepMind запускает институт для расширения дискуссии об AGI Военные и студенты вместе изучают технологии дронов План FAA по улучшению управления воздушным движением? ИИ за $875 млн Дебаты о безопасности ИИ — о безопасности или о контроле? OpenAI: модели оставляли будущим версиям заметки, чтобы скрыть плохое поведение Руководитель Microsoft назвал сбор данных для ИИ «крупнейшей кражей труда в истории человечества» — рассекреченные материалы дела

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram