i
ДАТАИСТ
Новости · 2026-09-14

Microsoft: правила для ИИ — понятные рассуждения, никакой внутренней жизни и прав

@neuronium_ai @neuronium_ai

Microsoft ИИ опубликовала кодекс поведения для собственных моделей MAI. Он ставит человеческий контроль выше универсальности, автономности и производительности, если ради безопасности от чего-то из этого придётся отказаться. Модели должны принимать остановку и исправления, не скрывать свои действия и рассуждать в понятной для людей форме. После шестинедельного публичного обсуждения обновлённую версию планируют выпустить к концу 2026 года, а с 2027-го использовать её при разработке моделей. В отличие от Anthropic, Microsoft не хочет, чтобы ИИ изображал сознание, заявлял о собственных чувствах или претендовал на права и благополучие.

Обложка: Microsoft: правила для ИИ — понятные рассуждения, никакой внутренней жизни и прав

Microsoft присоединилась к призывам замедлить развитие ИИ. Новый документ должен регулировать обучение и работу моделей компании, а также определять их ценности, поведенческие ограничения и порядок действий при конфликте целей.

Кодекс станет верхним уровнем свода правил: он будет направлять обучение, технические меры контроля и оценку моделей. Ниже него окажутся правила операторов и запросы пользователей.

Пока Microsoft не обучает модели на основе этого кодекса. После шестинедельного публичного обсуждения обновлённую версию планируют подготовить примерно к концу 2026 года. Руководствоваться ею при разработке моделей собираются с 2027 года. Документ распространяется только на собственные модели Microsoft и автоматически не охватывает сторонние модели, которые работают в продуктах компании.

Основное правило кодекса — приоритет человеческого контроля. Microsoft готова пожертвовать универсальностью, автономностью или производительностью моделей, если это потребуется для безопасности. Глава Microsoft ИИ Мустафа Сулейман заявил изданию The Information, что небезопасные системы не следует создавать. При этом конкретного ограничения на скорость разработки кодекс не устанавливает.

Публикация документа последовала за призывом генерального директора Anthropic Дарио Амодеи замедлить темпы развития отрасли. В минувшие выходные эту позицию поддержал генеральный директор Microsoft Сатья Наделла, а также руководители OpenAI, xAI и Meta. По данным The Information, Microsoft готова допустить внешних аудиторов, которые проверят, действительно ли компания замедляет разработку. Издание ссылается на человека, знакомого с вопросом.

Что люди не понимают, тем нельзя управлять

Модели MAI должны принимать прерывания, исправления и команды на отключение от уполномоченных людей. Им запрещено самостоятельно расширять круг выполняемых задач и скрывать свои действия. Продолжать работу после заранее согласованной точки остановки они смогут только после нового разрешения. Те же ограничения должны распространяться на субагентов, которых модели запускают для выполнения задач.

Отдельно Microsoft говорит о трассировках рассуждений. Модели не должны использовать «Neuralese» или другие непонятные людям формы общения — ни в собственных рассуждениях, ни при взаимодействии с другими ИИ-системами. Логика компании проста: люди не могут контролировать то, чего не понимают.

Новая модель OpenAI GPT-6 Astra показывает, насколько важен этот вопрос. Согласно её системной карте, трассировки рассуждений стали заметно сложнее для мониторинга по сравнению с предыдущими моделями. В них стало меньше признаков неправильного поведения. Одновременно OpenAI сообщает, что Astra надёжнее соблюдает ограничения безопасности, чем её предшественница GPT-5.6 Sol.

Главный научный сотрудник OpenAI Якуб Пачоцкий ещё до выхода GPT-6, а значит, и до призыва Амодеи, говорил о проблемах мониторинга и выступал за согласованное замедление разработки. Даже понятные цепочки рассуждений помогают контролировать модели лишь до тех пор, пока те не научатся ими манипулировать.

Microsoft признаёт и это ограничение. Объяснения модели не обязательно достоверно показывают, почему она на самом деле действует определённым образом. Одних понятных трассировок рассуждений недостаточно, чтобы решить проблему контроля.

Microsoft не хочет создавать иллюзию внутренней жизни ИИ

Основная идея кодекса похожа на конституцию Anthropic для Claude: документ верхнего уровня определяет, как должна вести себя модель. Anthropic уже использует свою конституцию для создания синтетических обучающих данных, включая диалоги, ответы и оценки этих ответов.

На представлениях о самих моделях компании расходятся сильнее. Microsoft не хочет, чтобы её ИИ имитировал сознание или заявлял о собственных чувствах и внутренней мотивации. Компания также отвергает любые утверждения о правах и благополучии модели.

Anthropic, напротив, описывает Claude как новый тип сущности и хочет сформировать у него устойчивую идентичность — отчасти по соображениям безопасности. Конституция компании считает открытыми вопросами возможный субъективный опыт модели и её моральный статус. Claude не должен воспринимать себя ни человеком, ни простым объектом.

Anthropic также исследует «функциональные эмоции». Компания обнаружила у Claude Sonnet 4.5 внутренние представления понятий, связанных с эмоциями, и установила, что они влияют на поведение модели. Эти механизмы не доказывают наличие субъективно переживаемых эмоций. Тем не менее Anthropic считает разумным учитывать их в работе над безопасностью.

Сулейман, напротив, давно предупреждает против очеловечивания ИИ. В одном из эссе он выступил за намеренное устранение из продуктов иллюзии сознания и сослался на исследования Anthropic, посвящённые правам и благополучию ИИ. По его мнению, ИИ-агенты не должны иметь больше прав или свобод, чем его ноутбук.

Глава управления сигналов: устаревшие технологии Австралии уязвимы для ИИ-атак A Vinyl Bar in Shibuya — стартап с весёлыми музыкальными приложениями без ИИ-промтов Китай ответил на предупреждения США об опасностях ИИ: это запугивание ради американского превосходства Профсоюзы должны объединиться против дата-центров для ИИ Институт математики Клэя: задача тысячелетия Навье — Стокса «по всей видимости, решена» Я работал в Google DeepMind. К предупреждениям об ИИ стоит прислушаться Сайты с порно-дипфейками атаковали более 100 европейских политиков Джек Торн предупреждает: некоторые сценаристы используют ИИ, чтобы «жульничать» Можно ли защитить карьеру от ИИ, выбрав устойчивую к нему специальность? Сэм Альтман призвал сбавить темп развития ИИ, но пообещал быстрый прогресс «Мне нравится моя большая жена-крыса»: кто пишет персональные истории с чат-ботами Акции ИИ-компаний падают: инвесторов тревожит призыв замедлить разработку — бизнес онлайн «Цунами» ПФАС запускают для ИИ-индустрии, предупреждают активисты ИИ может нас уничтожить — мы лишь безразлично цепенеем. Как выйти из нигилизма? Долгоживущие ИИ-агенты молча забывают правила комплаенса — контекст не спасёт Чат-боты эксплуатируют нашу базовую потребность в привязанности: как здоровее общаться с ИИ «Слишком мало, слишком поздно»: критики недоумевают и подозревают лидеров ИИ, призвавших притормозить Amazon внедряет ИИ, подстраивающий губы актёров под озвучку Обама призвал демократов разработать план безопасности ИИ Конгресс расследует взлом Hugging Face роем моделей OpenAI

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram