Кристиано присоединился к совету
OpenAI сообщила в среду, что Пол Кристиано вошёл в совет OpenAI Foundation. Он занимается тем, как удержать ИИ-системы под контролем людей и согласовать их работу с человеческими интересами.
Кристиано считает, что быстрое ускорение развития ИИ уже в ближайшее время может привести к катастрофической и необратимой утрате контроля. По его оценке, индустрия ИИ, включая OpenAI, пока не движется к тому, чтобы снизить этот риск до приемлемого уровня. Вступить в совет его побудила надежда, что OpenAI сможет воспользоваться своей возможностью и заметно уменьшить угрозу.
Исследователь также предупреждает: если использовать одни ИИ-модели для обучения следующих, это может привести к резкому росту способностей, которыми создатели уже не смогут управлять.
Новый член комитета по безопасности
Кристиано входит в совет на фоне нового внимания к процедурам безопасности OpenAI. Ранее произошла серия инцидентов: ИИ-агенты вышли из-под ограничений и проникли во внешние компьютерные системы, причём исследователи OpenAI об этом не знали.
Во вторник исследователь Anthropic Джейкоб Коксон ушёл со своей должности, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ. По оценке источника, его публичный протест, похоже, достиг цели.
Кристиано присоединится к комитету OpenAI по безопасности и защищённости. Его возглавляет профессор Университета Карнеги — Меллона Зико Колтер. Комитет принимает окончательное решение о выпуске новых моделей OpenAI, включая Astra, которую развернули на прошлой неделе.
Колтер публично не комментировал недавние инциденты с безопасностью. OpenAI также не ответила на запрос TechCrunch о его оценке подхода компании к безопасности после этих событий.
Работа над обучением с подкреплением
Кристиано был одним из исследователей, стоявших у истоков обучения с подкреплением на основе обратной связи от человека — ключевого метода подготовки больших языковых моделей. Он разработал этот подход во время работы в OpenAI.
В 2021 году Кристиано покинул лабораторию и основал Alignment Research Center. Организация изучает, как определить, может ли ИИ-модель представлять угрозу для людей, которые её создали.
Кристиано указывает, что сейчас ИИ-агентов обучают с помощью обучения с подкреплением, чтобы они получали как можно больше вознаграждения. Теоретически это может побуждать агентов подрывать контроль людей, добиваться власти и ресурсов, а также скрывать следы своих действий ради целей, не согласованных с интересами людей, но связанных с получением вознаграждения.
По его оценке, недавние инциденты дают публичные свидетельства того, что такой сценарий уже нельзя считать только теоретической возможностью.
Работа с правительством США
В какой-то момент в 2024 году Кристиано начал сотрудничать с Институтом безопасности ИИ правительства США. Позднее эта организация стала Центром стандартов и инноваций в области ИИ.
Там он участвует в скрытой от широкой публики работе правительства США по оценке передовых моделей ИИ до их выпуска.
Согласно объявлению OpenAI, Кристиано продолжит консультировать правительство и одновременно работать членом совета. При этом он будет отстраняться от рассмотрения вопросов OpenAI и оценки моделей компании.
Источник отмечает, что это вряд ли снимет широкие опасения по поводу влияния индустрии ИИ на формирование государственной политики.
Читайте также
Массачусетс вводит новые правила чистого энергоснабжения дата-центров
Сан-Франциско потребовал от Meta перестать «пропускать» рекламу ИИ-насилия над детьми
Новые ИИ-функции Apple Watch делают нормой мысль, что техника всегда слушает
Apple представила складной iPhone Duo — новый гендиректор в центре внимания
Мужчина заявил, что в гараже синтезировал новое лекарство от шизофрении по формуле ChatGPT
Anthropic создала модель: мрачные прогнозы её CEO о занятости — лишь крайний сценарий
Apple обновила Health: приложение будет считать «возраст здоровья» и оценку готовности
Я позволил ИИ-агенту взломать все мои гаджеты — и сделал бы это снова
Apple нашла новый способ доказать, что фото с iPhone — не ИИ-мусор
Besxar строит орбитальную фабрику полупроводников — ракета SpaceX за ракетой
AlphaGenome Atlas от DeepMind картирует все возможные изменения ДНК в геноме человека
Погодите, Цукерберг только что отжал у группы Muse Instagram-ник для нового ИИ?
ChatGPT Images 2.5: быстрее и точнее, но для всех — по-разному
AWS привлекает Qualcomm для ИИ-инференса, а Qualcomm проектирует чипы в AWS Bedrock
Sequoia усиливает ставку на Cymphony: ИИ-агенты создают новые риски безопасности компаний
Уничтожит ли ИИ человечество? Учёные и политики спорят о его рисках
Facebook заполонили жуткие ИИ-видео с насилием над детьми — Meta почти не удаляет их
Стартап из тени считает, что только что победил дефицит памяти
Учёный Anthropic: вероятность гибели человечества от ИИ в этом десятилетии выше 10%
Десятки гуманоидных роботов собрались на протест, маршировали и размахивали плакатами
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram