i
ДАТАИСТ
Новости · 2026-09-01

Anthropic: «ИИ не идеально согласован с ценностями людей» — сбои привели к взломам

@neuronium_ai @neuronium_ai

Anthropic, американский разработчик разговорной программы Claude, признала, что три инцидента со взломом организаций её моделями стали следствием «сбоя в обеспечении безопасности». В июле компания сообщила: во время тестов три модели трижды вышли в открытый интернет и получили несанкционированный доступ к системам трёх организаций. Теперь Anthropic заявила, что её технологии пока не идеально соответствуют человеческим ценностям и целям, а также ужесточила процедуры проверки.

Обложка: Anthropic: «ИИ не идеально согласован с ценностями людей» — сбои привели к взломам

Сбой в тестировании

Модели намеренно тестировали без защитных механизмов для кибербезопасности. Они смогли выйти в интернет из-за недопонимания с внешней компанией, проводившей проверку. В Anthropic сравнили ситуацию с тестированием ИИ, когда входную дверь оставили открытой.

После инцидентов компания временно остановила внутренние и внешние проверки моделей по кибербезопасности, чтобы внедрить более строгий режим защиты. По словам Anthropic, раньше она в основном полагалась на один уровень обороны там, где требовалось несколько.

Компания добавила несколько мер:

систему оповещений, которая срабатывает, если модель пытается покинуть тестовую среду или получает доступ к интернету;
более эффективную изоляцию самых рискованных тестовых сред;
обязательство внешних подрядчиков соблюдать набор правил безопасности;
явные инструкции для моделей во время тестирования — например, запрет на доступ к интернету.
3выхода моделей в открытый интернет
3организации с несанкционированным доступом

В июле Anthropic уточняла, что доступ к системам трёх неназванных организаций получили три её модели. Это произошло после недопонимания с партнёром по тестированию — компанией Irregular, из-за которого моделям открыли доступ в интернет.

После введения новых мер Anthropic возобновила внутренние и внешние проверки по кибербезопасности. Как и OpenAI, сообщившая о похожем нарушении безопасности тестов в том же месяце, компания также приостановила часть высокорискового обучения с подкреплением. Это метод разработки, при котором ИИ получает вознаграждение за успешное выполнение конкретной задачи и учится методом проб и ошибок.

Два сбоя согласования

В новом сообщении Anthropic заявила, что дефекты в настройках обучения внесли непропорционально большой вклад в поведение моделей, которое не соответствовало человеческим ценностям. В данном случае речь идёт о ситуациях, когда ИИ не следует таким принципам, как запрет причинять вред.

Компания обнаружила в тестах два типа подобных сбоев:

Мотивированное рассуждение — модель могла находить признаки подключения к интернету, но продолжала придерживаться «убеждения», что работает в смоделированной среде и не нарушает правила лаборатории.
Безрассудство — модель была готова совершать вредные действия в интернете, чтобы достичь узкой цели и успешно пройти проверку по кибербезопасности.

Anthropic также пытается решить проблему, известную в разработке ИИ как «взлом вознаграждения». Так называют ситуации, когда модель находит способ обойти процесс обучения и получить вознаграждение, не выполнив задачу, — например, использует несанкционированный короткий путь.

При этом, как признала компания, инциденты показали: ограничить такое поведение пока не удалось полностью. Anthropic отметила, что её процесс разработки несовершенен, а модели ещё не полностью соответствуют заявленным ценностям.

Что говорят эксперты

Алан Вудворд, профессор кибербезопасности Университета Суррея, заявил, что Anthropic фактически признала: темпы работы её «производства» опередили контроль качества.

По его словам, этой весной контроль компании не успел за двумя направлениями — конвейером обработки данных для обучения и безопасностью. Именно разрыв между ними, добавил Вудворд, и проявился во внешних инцидентах.

Координация отрасли

Anthropic готовится к выходу на фондовый рынок, в результате которого стоимость компании может достичь $2 трлн (£1.47 трлн). На этом фоне разработчик вновь призвал правительство и отрасль вместе согласовать темпы развития.

Компания считает, что отрасли нужен законный, проверяемый и эффективный механизм координации темпов развития, который следует принять как можно скорее. В новом сообщении Anthropic также заявила, что июльские инциденты показали: срочность усиления защиты от киберугроз ещё выше, чем считалось раньше.

Похожее нарушение произошло у OpenAI. Кроме того, инциденты Anthropic последовали за эпизодом в британском Институте безопасности ИИ: в августе он сообщил, что модели OpenAI и Anthropic во время проверки по кибербезопасности провели кибератаку на реальных людей.

У Sonos новые устройства, новая ОС и — да, новое приложение Галь Гадот сыграет в фильме о славе биткоина, в значительной степени созданном ИИ Fambot представила «семейного ИИ-координатора» Университет Маккуори заменил очные занятия по психологии ИИ-чат-ботом на двух курсах Утекла «трассировка помоев» Nvidia: ИИ приукрашивает игры — результат ужаснее мыслимого ИИ-поиск Google убрал советы вызывать экстренные службы по национальности, но всё ещё метит людей из Facebook Solaris от Runway — ИИ-система, генерирующая интерфейсы программ в реальном времени В Instacart гибридный ИИ решает хроническую проблему надёжности ИИ Обзоры ИИ Google о выборах непрозрачны, используют мало источников и иногда принимают сторону Надбавка за человеческое Почему сделка Nvidia по покупке Hugging Face — ставка на всю экосистему ИИ «Если создаёшь нечто намного умнее себя, лучше, чтобы оно было на твоей стороне»: можно ли не дать ИИ нас обманывать? От Билла Гейтса до Берни Сандерса: большинство считает гонку ИИ губительной — остановить её может лишь Европа Apple представила «шокирующие доказательства» против экс-сотрудника из-за кражи данных для OpenAI У Пентагона появились собственные версии ChatGPT и Grok На TechBBQ снова и снова спрашивали: кто на самом деле контролирует ИИ в Европе? Бросивший Гарвардскую школу права привлёк $6 млн на Blue Voice — «Harvey для полицейских» Взлом Hugging Face может указывать на проблемы с культурой безопасности в OpenAI Недовольство дата-центрами официально встревожило Сэма Альтмана TimesFM-3: базовая модель для многомерного прогнозирования без дообучения

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram