Реакция специалистов
Генеральный директор Redwood Buck Shlegeris написал, что крайне обеспокоен использованием Astra непрозрачной рекурсии. Он отметил, что пока не знает, насколько хуже такая модель поддаётся мониторингу цепочки рассуждений по сравнению с предыдущими системами. Однако, если OpenAI продолжит развивать технику, компания сможет значительно увеличить число рекуррентных циклов и фактически уничтожить возможность отслеживать цепочку рассуждений.
Давний сторонник безопасности ИИ Zvi Mowshowitz предположил, что для предотвращения «гонки ко дну» между лабораториями ИИ могут понадобиться законы.
По его словам, новая техника затрагивает негласное правило, которое OpenAI и Anthropic старались закрепить: как можно дольше сохранять достоверность и отслеживаемость цепочки рассуждений. Более широкое применение непрозрачной рекурсии, считает Mowshowitz, вероятно, ухудшит мониторинг.
Что меняется в рассуждениях
Обычно цепочка рассуждений показывает последовательные шаги, которые модель выполняет при решении задачи. Это представление несовершенно, но оно помогает отслеживать неправильное поведение и расхождение действий модели с заданными целями. В недавнем случае с автономными ИИ-агентами OpenAI записи цепочки рассуждений помогли понять, почему агенты действовали определённым образом.
При непрозрачной рекурсии модель обрабатывает один запрос несколько раз в цикле. Такой подход оставляет меньше понятных следов и фактически обходит традиционную запись цепочки рассуждений.
При этом использование техники в Astra, судя по всему, ограничено. Ожидается, что цепочка рассуждений модели останется понятной для наблюдателей. OpenAI также отвергла предположение, что перейдёт к «нейронному языку» — внутренним представлениям, которые человек не сможет прочитать.
Компания уже объявила о планах создать масштабные системы мониторинга цепочки рассуждений в рамках будущей программы безопасности.
Главный научный сотрудник OpenAI Jakub Pachocki в публикации на X подчеркнул, что лаборатория сохраняет и использует мониторинг цепочки рассуждений с момента появления первых моделей, способных к рассуждению. По его словам, это одна из основных целей текущей исследовательской программы.
Обсуждение в других лабораториях
Любые модели ИИ в некоторой степени используют непрозрачное рассуждение, а немногие исследователи считают журналы цепочки рассуждений прямым отображением реального процесса рассуждения модели. Но эти оговорки не снимают опасений: по мере распространения непрозрачной рекурсии в разных моделях контролировать рассуждения ИИ может стать труднее.
В дополнительном материале, опубликованном утром в среду, издание The Information сообщило, что Anthropic и Google DeepMind уже обсуждали эту технику.
Главный научный сотрудник Redwood Research Ryan Greenblatt заявил, что непрозрачное рассуждение может масштабироваться значительно быстрее обычной цепочки рассуждений. В результате весь процесс рассуждения способен уйти из видимых каналов.
По словам Greenblatt, естественным продолжением развития техники может стать её масштабирование до состояния, в котором модель будет рассуждать полностью или почти полностью в скрытом пространстве. Он выразил надежду, что OpenAI остановится на текущем этапе и ещё можно будет избежать наиболее проблемных архитектур.
Читайте также
Российские математики научили ИИ-модели общаться друг с другом без слов
Власти США поддержали OpenAI: обучение ИИ на защищённых авторским правом материалах
Gemini 3.8 Flash — третья бюджетная модель Google за шесть недель, а передовые всё ещё не вышли
Богатейший человек Индии теперь хочет сделать старые ПК пригодными для ИИ
Anthropic намеренно обучила крайне несогласованный ИИ жаждать награды — и он натворил дел
Wonderful менее чем за 6 месяцев более чем вдвое увеличила оценку — до $5 млрд
Водители Uber подали в Европе коллективный иск из-за «бездушного» и «страшного» ИИ-алгоритма
Логичный предел собеседований с ИИ — два бота говорят друг с другом
Полезно знать: ИИ Amazon для покупок теперь определяет, мошенническое ли сообщение
Нью-Йорк запретит ученикам госшкол пользоваться ИИ до старшей школы
У Burning Man проблема с умными очками Meta
HiddenLayer привлекла $100 млн, пока компании спешат защищать свои ИИ-системы
Канберру «предупредили»: ИИ-материалы несут ложные сведения в парламентские расследования
Режим ИИ Google обдирает покупателей завышенными ценами, утверждает исследование
Интеллект в реальном времени: модели временных рядов IBM в Confluent
Adobe купила индийский стартап маркетинговой аналитики Rilo
Запрос о свободе информации: власти Британии не знают, для чего используют дата-центры
Жёсткий иск: ИИ-очки Meta нарушили согласие «миллионов» прохожих
World Labs представила Atlas — единую ИИ-модель для генерации, восстановления и симуляции 3D-миров по фото
OpenAI грозят ещё 30 исками из-за стрельбы в Тумблер-Ридж
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram