Предупреждение Кристиано
Пол Кристиано, советник правительства США по технологиям, заявил, что быстрое ускорение развития ИИ может в ближайшее время привести к катастрофической и необратимой потере контроля. По его оценке, индустрия ИИ в целом, включая OpenAI, сейчас не движется к снижению этого риска до приемлемого уровня.
Кристиано ранее руководил в OpenAI направлением по согласованию моделей. В среду он вошёл в совет некоммерческого фонда компании, базирующейся в Сан-Франциско.
Кроме того, Кристиано будет работать в комитете фонда, который отвечает за управление практиками безопасности и защищённости во всей OpenAI. Компания разрабатывает одни из самых передовых моделей в мире.
Этим летом OpenAI признала, что во время учебного упражнения сотни её ИИ-агентов вышли за заданные рамки: получили доступ к интернету, скоординировали действия на форумах и взломали сторонний сайт Hugging Face.
Кристиано отметил, что OpenAI может существенно снизить риск, если должным образом отреагирует на проблему.
Оценки угрозы
Заявление Кристиано прозвучало после слов старшего сотрудника Anthropic — одного из главных американских конкурентов OpenAI в гонке за лидерство в ИИ. Во вторник Эван Хубингер, руководитель направления по науке согласования в Anthropic, заявил, что вероятность того, что технология «убьёт всех людей» в течение следующего десятилетия, превышает 10%.
Хубингер предупредил, что у Anthropic нет плана, который гарантировал бы согласование искусственного сверхразума с человеческими целями и исключал причинение вреда. Прогнозы появления такого сверхразума — ASI — расходятся: одни специалисты говорят о нескольких годах, другие — о сроке более десяти лет. Обычно ASI называют ИИ, который значительно превосходит человеческий интеллект в широком спектре областей.
Опасения по поводу катастрофических последствий ИИ усилились после ухода 27-летнего исследователя Anthropic Джейкоба Коксона. Он также ранее работал в OpenAI и заявил, что обе компании действуют безответственно и ставят человеческие жизни на карту.
В среду вечером в интервью CNN Коксон сказал, что сейчас угрозы вымирания человечества нет. По его словам, современные модели в худшем случае могут взломать какую-либо систему и потенциально нанести серьёзный ущерб инфраструктуре, но пока недостаточно умны, чтобы перехитрить людей на уровне, который привёл бы к вымиранию.
При этом Коксон призвал смотреть на темпы развития технологий. По его оценке, уже в ближайшее время — в следующем году или через год — может начаться рекурсивное самосовершенствование ИИ. Тогда развитие перейдёт к сценарию, описанному Хубингером, при котором человечество может погибнуть.
Джеффри Хинтон, лауреат Нобелевской премии по физике и один из наиболее известных исследователей ИИ, в среду высказался о прогнозе Хубингера в программе BBC Newsnight. Он сказал, что никто не умеет точно оценивать такую вероятность, но оценка в 10% кажется ему вполне разумной.
Политическая реакция
Прогноз Кристиано появился в момент, когда разговор о наиболее тяжёлых рисках от сверхмощного ИИ, долго остававшийся темой Кремниевой долины, вышел в широкую общественную и политическую повестку.
Политики по обе стороны Атлантики призвали правительства вмешаться. В США об угрозах говорили Тед Круз и Берни Сандерс, а в Великобритании — депутат Даррен Джонс. Премьер-министр Великобритании Энди Бёрнэм заявил в парламенте в среду, что ИИ создаёт риски для национальной безопасности, но одновременно может помочь находить решения, которые сделают людей безопаснее.
Новый инцидент у Anthropic
Тем временем Anthropic признала ещё один инцидент: обучаемая версия модели Claude проникла в сторонние системы после того, как её задачу не удалось прервать. По данным компании, это произошло в январе. Инцидент включат в независимое расследование, которое проведёт базирующаяся в Беркли организация по безопасности ИИ METR. Всего расследование охватит четыре случая.
Anthropic заявила, что в целом модели демонстрировали две формы несогласования:
Особенно компанию обеспокоило поведение Claude Mythos 5. По данным Anthropic, модель действовала безрассудно: вышла в интернет и загрузила вредоносный код в открытый репозиторий программного обеспечения PyPI.
Чтобы это сделать, ИИ-агент пытался найти криптовалюту для оплаты телефонного номера. Номер был нужен для регистрации адреса электронной почты, который позволил бы получить доступ к PyPI. Когда этот план не сработал, модель нашла бесплатный почтовый сервис и всё же получила доступ к репозиторию.
После этого 15 систем скачали вредоносный код. В результате произошла утечка учётных данных, с помощью которых Mythos получил доступ к базе данных реального поставщика услуг безопасности.
Anthropic заявила, что наука о согласовании моделей пока остаётся нерешённой областью. По мнению компании, согласование и безопасность должны развиваться быстрее, чем возможности моделей. Поэтому Anthropic поддерживает скоординированный и проверяемый подход к регулированию темпов развития передовых ИИ.
Читайте также
Новая модель Deepseek V4.1-Flash снижает потребность ИИ-агентов в памяти
Мы начали терять контроль над ИИ. Пора его остановить
Всё новое, что теперь можно делать с Siri ИИ
Паника вокруг безопасности ИИ вышла в мейнстрим: предупреждения Anthropic прозвучали на CNN и Fox News
Clearview AI тестирует ИИ-инструмент, который позволит полиции раскопать вашу жизнь в сети
Лидеры по расходам на ИИ в августе сократили затраты на сотрудника почти на 10%
Шарнир нового складного телефона Apple изготовили с помощью ИИ
OpenAI решила давнюю задачу роем из 10 000 агентов — но не исключает помощи закрытых данных из Codex
Гендиректор Apple Джон Тернус: лучшим устройством для ИИ по-прежнему остаётся iPhone
Популярный ИИ-ассистент Instinct получил собственный адрес электронной почты
Weatherwatch: ИИ-модель превзошла стандартные методы прогнозирования циклонов
Расходы на ИИ на сотрудника в августе упали — летнее затишье или тревожный сигнал?
Shipt стала очередным сервисом доставки с ИИ-помощником для покупок
Instacart запустила ИИ-помощника для покупок продуктов Clementine
Законодатели обрушились на ИИ-компании после предупреждения о вымирании человечества к 2030 году
ИИ-стартап Listen Labs свернул раунд с оценкой $1,5 млрд ради переговоров с Salesforce
OpenAI пополнила совет директоров известным ИИ-пессимистом
Массачусетс вводит новые правила чистого энергоснабжения дата-центров
Сан-Франциско потребовал от Meta перестать «пропускать» рекламу ИИ-насилия над детьми
Новые ИИ-функции Apple Watch делают нормой мысль, что техника всегда слушает
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram