Самоулучшение будет медленным
Через несколько дней после ухода из Google DeepMind Ориол Виньялс выступил на Agentic ИИ Summit 2026 и рассказал о рекурсивном самоулучшении ИИ — одной из обсуждаемых тем в исследованиях ИИ. Виньялс был вице-президентом по исследованиям в DeepMind и участвовал в создании AlphaStar, AlphaCode и Gemini.
Он считает неизбежным постепенное самоулучшение систем, но не ожидает внезапного ускорения их интеллектуального развития. Измерять прогресс в самоулучшении трудно, а реализовать его на практике ещё сложнее. По оценке Виньялса, ИИ сможет ускорить отдельные исследовательские и инженерные задачи в десять и более раз, но самоподдерживающийся взрыв интеллекта маловероятен.
Что именно должно улучшаться
Сначала нужно определить, какую часть системы предполагается менять. У ИИ много компонентов, и улучшения могут затрагивать каждый из них:
Для каждого направления возникают свои технические и регуляторные сложности.
По словам Виньялса, системе, которая пытается улучшить себя, нужны перспективная идея, код для её реализации, эксперименты для проверки и надёжный способ понять, принесло ли изменение пользу. С двумя средними этапами ИИ уже справляется лучше: он пишет код и проводит эксперименты. Основные проблемы остаются на этапах генерации идей и оценки результата.
Два главных узких места
Сегодня лаборатории в основном измеряют самоулучшение косвенно — через бенчмарки способностей вроде SWE-Bench Pro и ML-Bench. Системы поднимаются в таблицах лидеров, а исследователи надеются, что самоулучшение возникнет как побочный эффект. Такие тесты недороги и хорошо определены, но преимущественно проверяют реализацию и эксперименты — именно те этапы, которые уже работают.
Дополнительные проблемы создают переобучение и поиск обходных путей. За годы работы над игровыми агентами Виньялс наблюдал, как системы используют цели неожиданным образом: они побеждают систему подсчёта очков, вместо того чтобы действительно играть по правилам игры.
Более содержательные бенчмарки должны проверять самоулучшение напрямую. Первые такие тесты уже появляются: системе задают метрику и бюджет вычислений, а затем измеряют, насколько она смогла улучшить себя. Этот подход дорогой, потому что для каждой оценки агент должен часами выполнять задачи, далёкие от конечной цели. Например, агент может оптимизировать игру «Тетрис», тогда как настоящая задача заключается в автоматизации целой исследовательской лаборатории и создании лучшей в мире модели.
Генерация идей развита не лучше. Для хорошего исследования нужен инстинкт, позволяющий понять, какие идеи вообще стоит развивать. Виньялс называет это «исследовательским вкусом». В обучении больших языковых моделей пока почти не изучали, как сформировать такую способность.
В будущем оценки, по мнению Виньялса, должны учитывать не только достигнутый результат, но и путь к нему. Для идей это означает проверку по критериям, которыми пользуются рецензенты научных конференций:
Некоторые из этих критериев можно описать правилами и проверять с помощью моделей вознаграждения, а затем использовать для обучения с подкреплением. Однако сделать это трудно, и на такую работу потребуется больше времени. Проверка людьми тоже обходится дорого и не всегда позволяет заметить сильные идеи.
Есть и физические ограничения. Чипы не могут вычислять быстрее, чем позволяют их конструкция и скорость света. Поэтому даже алгоритм, разработанный ИИ, всё равно ограничен оборудованием, на котором запускается. В некоторых областях возможности человека уже могут быть близки к верхнему пределу. Виньялс приводит пример AlphaGo: неизвестно, насколько хорошо эта система играет по сравнению с идеальной партией в го.
Discovery Loop автоматизирует научный цикл
Виньялс решил проверить свои выводы на практике и создаёт стартап Discovery Loop. Вместе с ним компанию основывают Джефф Дин, который станет генеральным директором, старший научный сотрудник Google Санджай Гхемават и сооснователь Google Brain Куок Ле.
Компания хочет автоматизировать полный научный цикл:
В проект входят и два этапа, на которых ИИ пока особенно слаб: создание идей и проверка их ценности. Трое из четырёх основателей входят в число наиболее цитируемых исследователей ИИ, а Гхемават также относится к наиболее цитируемым специалистам по распределённым системам.
Сначала команда займётся исследованиями ИИ. Сам Discovery Loop станет первым заказчиком собственных инструментов — так это сформулировал Джефф Дин. Позже стартап планирует перейти к другим научным областям.
На сайте компании основатели описывают будущее, в котором небольшая группа людей сможет проводить научные и инженерные исследования быстрее и качественнее, чем сегодня это делают крупные коллективы учёных и инженеров. Виньялс признаёт, что создание идей остаётся самой сложной частью процесса, поэтому на раннем этапе люди и машины будут разрабатывать гипотезы совместно.
Источник: the-decoder.com
Читайте также
Nscale добавила экс-руководительницу OpenAI Фиджи Симо в совет перед возможным IPO
Леденящие предупреждения: депутаты Британии призвали Энди Бёрнэма запретить создание сверхинтеллекта
Одна из самых яростных критиков ИИ считает разговоры о конце света отвлекающим манёвром
Хакеры использовали Claude для ракет, роёв дронов и слежки, а китайские лаборатории добывали из него данные для обучения
Математический институт безопасности ИИ хочет доказать его безопасность, как криптографы — стойкость шифров
Anthropic: пресечены попытки иностранцев использовать Claude для создания возможного биооружия
Новый Agents API OpenAI даёт разработчикам основу, на которой работают Codex и ChatGPT
Мы должны поставить рискованные исследования ИИ на паузу, пока ещё можем это сделать
Коллективный иск: Anthropic обвиняют в завышении подписочных лимитов Claude с помощью обманных множителей
Книжное соглашение Anthropic на $1,5 млрд тонет в хаосе: авторы и издатели спорят, кому платить
Экономика Великобритании удивила прогнозы, выросши в июле на 0,4%
DeepSeek-V4.1-Flash вышла: $0,003 за 1 млн кэшированных входных токенов вне пика и результаты выше GPT-5.6 Sol и Claude Opus 5
OpenAI хочет выяснить, будет ли вообще законным замедление развития ИИ-отрасли
Anthropic раскрыла кампании по дистилляции Alibaba, Moonshot AI и DeepSeek
Anthropic описала, как злоумышленники пытались использовать её ИИ для биооружия
ToolGrad: датасеты для работы с инструментами генерируют с «текстовыми градиентами»
Дженсен Хуанг объяснил, почему Nvidia вырастет на ошеломительные 70% в следующем году
Исследователи Anthropic предупреждают об опасностях ИИ; Маск называет страхи «психоперацией»
Роботы учатся чувствовать мир на ощупь
OpenAI приостановила новые подписки Pro из-за спроса на Astra
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram