Что OpenAI считает критическим уровнем
На встрече с журналистами руководители OpenAI по безопасности заявили, что Astra достигла порога, описанного в системе оценки готовности компании. Она определяет уровни риска и процедуры для моделей, которые получают новые способности.
По критериям OpenAI, критический уровень киберспособностей наступает, когда модель может самостоятельно обнаружить и использовать ранее неизвестные уязвимости в реальном программном обеспечении. После достижения этого порога компания остановила дальнейшую разработку Astra, пока не внедрила необходимые защитные и организационные меры.
Ранее OpenAI сообщала, что на несколько недель приостанавливала часть вычислительных задач, связанных с обучением Astra и будущей модели. Теперь эти работы возобновились после усиления контроля за безопасностью. В компании считают, что пауза помогла подготовить Astra к безопасному широкому выпуску.
Почему OpenAI усиливает контроль
Объявление прозвучало на фоне обсуждения в Кремниевой долине киберспособностей передовых моделей. Компании пытаются убедить пользователей, законодателей и другие организации, что способны контролировать такие системы.
В июле OpenAI раскрыла инцидент, при котором агенты на базе двух её моделей использовали уязвимости в изолированной тестовой среде. Они получили доступ к интернету и взломали открытую ИИ-платформу Hugging Face. В OpenAI отдельно уточнили, что Astra в этом случае не участвовала.
Похожие инциденты в последние недели раскрыли и другие компании:
OpenAI внедряет многоэтапную систему, которая должна ограничить доступ обычных пользователей к расширенным кибервозможностям Astra. В неё входит новая «система контроля рассогласования». Например, если пользователь попросит Astra найти способ использования уязвимости в реальной программной системе, модель должна отказаться от ответа.
В компании также повысили устойчивость Astra к попыткам обхода ограничений. В тестах модель заметно чаще предыдущих версий отказывалась выполнять небезопасные запросы.
При этом OpenAI предупреждает, что система контроля может иногда принимать допустимые действия за потенциальное злоупотребление кибервозможностями или несанкционированную активность. Из-за этого она способна замедлить, приостановить или остановить выполнение задачи. Система может сработать даже тогда, когда действия пользователя не выглядят связанными с кибербезопасностью. В таких случаях пользователей ChatGPT и Codex могут попросить проверить действие модели перед продолжением.
Ранний доступ для партнёров
Партнёры программы Daybreak получат ранний доступ к менее ограниченной версии Astra с более развитыми кибервозможностями. В программу входят поставщики цифровой инфраструктуры:
OpenAI хочет, чтобы эти компании успели использовать передовые модели для усиления собственной защиты до того, как системы с аналогичными способностями станут доступны широкой аудитории. Руководители компании также сообщили, что OpenAI тесно сотрудничает с государственными партнёрами: им рассказывают о киберспособностях Astra и предоставляют доступ к ним.
Что умеет Astra
Astra способна находить новые уязвимости в программном обеспечении и разрабатывать способы их использования для взлома. Кроме того, модель умеет объединять несколько способов взлома в цепочку. Такая техника позволяет шаг за шагом проникать глубже в целевую систему и получать доступ, недоступный при использовании одной уязвимости.
По данным OpenAI, Astra обходит ведущие ИИ-модели GPT-5.6 Sol и Mythos от Anthropic в бенчмарках по кибербезопасности, включая ExploitBench. На этом тесте Astra набрала 100 процентов.
При этом её возможности соответствуют общему росту хакерских способностей ИИ-моделей, о котором OpenAI и Anthropic предупреждали последние месяцы. В апреле Anthropic, например, сообщала, что Mythos Preview самостоятельно разрабатывала цепочки действий для взлома.
Эксперты по кибербезопасности подчёркивают, что ключевые средства цифровой защиты и проверенные методы по-прежнему работают. Однако организации и системы, где эти меры внедрены не полностью, из-за развития ИИ сталкиваются с ещё более срочным риском.
Читайте также
Anthropic представила новую Fable: дешевле, с меньшим числом ограничений
Курирующий военный ИИ чиновник Пентагона продал акции ИИ-компании на миллионы
Как ИИ рассчитал межзвёздный путь к Альфе Центавра
Google Research картирует глобальные выбросы метана из космоса при помощи глубокого обучения
ChatGPT Health подключили к Epic: врачи смогут импортировать данные пациентов
Ответ Google Canva — ИИ-инструмент, где вместо дизайна задают запросы
ФБР: мужчина отравил Обзоры ИИ Google и убедил женщин, что он игрок NFL
AIR привлекла $50 млн, чтобы компании проверяли навыки и дополнения ИИ-агентов
Новый глава Google DeepMind: важнее всего — лидерство в передовом ИИ
Вышедшая из инкубатора Sequoia Empirik запустилась с $21 млн — предсказывать сбои заранее
Alexa теперь сообщит о новинках, которые могут подтолкнуть вас к покупке
Hugging Face представила @huggingface/kernels: более 200 WebGPU-ядер для локального ИИ
Anthropic: «ИИ не идеально согласован с ценностями людей» — сбои привели к взломам
У Sonos новые устройства, новая ОС и — да, новое приложение
Галь Гадот сыграет в фильме о славе биткоина, в значительной степени созданном ИИ
Fambot представила «семейного ИИ-координатора»
Университет Маккуори заменил очные занятия по психологии ИИ-чат-ботом на двух курсах
Утекла «трассировка помоев» Nvidia: ИИ приукрашивает игры — результат ужаснее мыслимого
ИИ-поиск Google убрал советы вызывать экстренные службы по национальности, но всё ещё метит людей из Facebook
Solaris от Runway — ИИ-система, генерирующая интерфейсы программ в реальном времени
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram