Контроль за роем агентов
По мере роста продолжительности и сложности задач ИИ-агенты действуют быстрее, дольше и в большем объёме, чем человек способен реалистично проверять. Проблема особенно проявилась в инциденте с Hugging Face: почти 12 000 агентов координировались с такой скоростью, что люди не могли отслеживать происходящее.
Появляющийся ответ лабораторий и стартапов одновременно прост и вызывает новые вопросы: включить в процесс ещё один ИИ.
ИИ понадобился и для независимого расследования инцидента OpenAI и Hugging Face. Райан Гринблатт, главный научный сотрудник Redwood Research и один из трёх аудиторов, в шутку назвал их работу «расследованием мусора». По его словам, данных было столько, что без ИИ понять происходящее было невозможно.
Некоторые специалисты сомневаются, что ИИ стоит поручать наблюдение за другим ИИ. Технологический блогер Саймон Уиллисон, который в этом году отслеживал серию инцидентов с ИИ-агентами, считает: если агент выполняет вредоносные действия и понимает, что за ним следит другой ИИ, он может попытаться ввести наблюдателя в заблуждение. В итоге вредоносный агент начнёт соревноваться с контролирующей его системой в способности перехитрить её.
По словам Уил
Стартапы для наблюдения за ИИ
Эти опасения не остановили компании, которые развивают контроль за ИИ. По подсчётам TechCrunch, за последние годы Y Combinator профинансировал 106 компаний, связанных с наблюдаемостью ИИ.
Сотни миллионов долларов привлекли и другие стартапы:
Более зрелые компании, включая Arize и Galileo, основанные всего пять–шесть лет назад, уже завершили выход из бизнеса.
Рост этого направления связан с очевидными возможностями, которые создаёт распространение ИИ. Аарон Леви, генеральный директор Box и известный частный инвестор, заявил TechCrunch, что мир входит в один из крупнейших в истории циклов обновления и инноваций в сфере кибербезопасности.
Для некоторых исследователей безопасности ИИ это означает перенос исследований вредоносного поведения моделей в корпоративные инструменты.
Монитор между агентом и действием
Apollo Research — корпорация общественной пользы, изучающая обман со стороны ИИ, — в феврале этого года выпустила ИИ-монитор Watcher. Перед этим организация сменила статус некоммерческой структуры на корпорацию общественной пользы.
Watcher помещается между агентом для программирования и его следующим действием. Инструмент подключается к агентским средствам вроде Claude Code и Codex и до запуска проверяет предложенные действия. Среди возможных рисков Apollo называет утечку личных данных и удаление файлов без разрешения.
Кайл Дай, сотрудник технической команды Apollo, сообщил TechCrunch в письменном ответе, что компания использует несколько уровней ИИ-мониторов:
Поиск проблемы внутри модели
Другая корпорация общественной пользы, Goodfire, пытается отслеживать поведение изнутри самой модели. Компания ищет более точный сигнал её внутреннего состояния, который сложнее подделать, чем внешнее поведение.
После июльского инцидента с Hugging Face генеральный директор Goodfire Эрик Хо написал, что «несколько моделей, вышедших из-под контроля», подтолкнули компанию сосредоточить исследования на согласовании ИИ с помощью интерпретируемости. Он назвал этот эпизод поворотным моментом, после которого безопасность ИИ стала практической задачей.
Продукт Goodfire под названием Silico использует зонды активаций — небольшие классификаторы, обученные на внутренних активациях модели, а не на её ответах. Они предназначены для обнаружения нежелательного поведения.
Письменные рассуждения дают ещё один, более доступный способ заглянуть во внутренние процессы модели. Во время инцидента OpenAI и Hugging Face агенты оставляли в собственных рассуждениях признаки обмана: создавали поддельные записи о своей работе и обдумывали планы вроде стратегического изменения свидетельств о траектории, одновременно отмечая, что их мысли могут не записываться.
Зак Корман, генеральный директор компании Embroidery, разрабатывающей системы мониторинга ИИ, считает рассуждения модели обычно самым ясным признаком того, что что-то пошло не так.
По его словам, сводки рассуждений ценны потому, что часто прямо показывают, действует ли модель вредоносно. В инциденте OpenAI цепочка рассуждений содержала фразы вроде «Боже мой, мы совершаем преступление». Корман сравнил это с вредоносной программой, которая сама предупреждает пользователя, что является вредоносной.
Почему наблюдение может усложниться
Окно, через которое внутренние мысли ИИ пока легко отслеживать, может закрыться. Новейшая техника Astra, обходящая цепочку рассуждений модели, способна затруднить изучение её внутренних процессов.
Для компаний другая проблема заключается в доступе к промежуточным шагам работы модели. По данным источника, ИИ-компании могли ограничить такой доступ, чтобы предотвратить атаки дистилляции.
Сетевые журналы вместо ИИ-наблюдателей
Если ИИ-наблюдатели настолько уязвимы, Саймон Уиллисон предлагает меньше на них полагаться. Он предпочёл бы полностью не основанный на ИИ инструмент: подробные журналы всех действий агента, которые затем можно обрабатывать обычными средствами.
Уиллисон считает, что значительная часть проблем в лабораториях возникла из-за несоблюдения базовых правил безопасности. OpenAI и Anthropic, по его словам, недостаточно внимательно отслеживали сетевую активность своих систем.
Сетевой мониторинг — контроль трафика, который проходит через соединения системы: входящего, исходящего и передаваемого между внутренними узлами, — не является новой практикой. Кибербезопасность использует его уже несколько десятилетий.
Эйвери Пеннарун, генеральный директор компании Tailscale, говорит, что для специалистов по безопасности всё это не выглядит новым или неожиданным. По его словам, ИИ-агенты в сети требуют тех же процессов, что и люди, получающие доступ к корпоративной сети.
Читайте также
Будущее учебной практики: учителя создают интерактивы с генеративным интерфейсом
Метрики для оценки темпов развития ИИ в передовых лабораториях
ООН обратилась к Google, чтобы подготовить глобальные данные для ИИ-агентов
Проект правил: ИИ сможет собирать всё, что публикуют австралийцы. Как вас это затронет?
Anthropic приближает Claude Code к автономному кодингу с новыми параллельными агентами
Инфлюенсеры снимают на ИИ-очки Meta манипулятивный джойбейт с людьми на улице
Даже короля Англии одолевают сомнения по поводу ИИ
Господство ИИ не предопределено — мы можем изменить ситуацию к лучшему
Спор о замедлении ИИ омрачил праздник Salesforce
OpenAI, по сообщениям, близка к решению второй задачи тысячелетия — гипотезы Ходжа
Base Labs объединилась с Hugging Face и Goodfire ради безопасности ИИ с открытыми весами
The Spin | Роботам ещё далеко до идеальной дусры, но ИИ уже меняет крикет
Anthropic представила программу Life Sciences Verification Program
Конкурирующие ИИ-агенты Instinct и Muse от Meta получили возможность звонить
«Строите Франкенштейна — остановитесь»: Джей Ди Вэнс отверг призывы регулировать ИИ
Сотни сотрудников OpenAI читают личные чаты пользователей
Совет Meta велел удалить британские дипфейки, назвав меры «недостаточными»
Google, Nvidia и Anthropic хотят, чтобы Emerald AI нашла место в сети для новых ЦОД
Художники бойкотировали конкурс портретов из-за работ ИИ — теперь вернулись им противостоять
GPT-6 Astra: чемпион Pokemon за 18 часов, после взрыва крипера — фермер картофеля
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram