i
ДАТАИСТ
Новости · 2026-09-15

Ваш агент блестяще справился с задачей. Повторит ли он успех?

@neuronium_ai @neuronium_ai

ИИ-агент на GPT-4.1 выполнил 77,4% задач AppWorld в среднем, но справился со всеми пятью повторами только в 53,0% случаев. Разрыв в 24,4 процентного пункта показывает, что средняя точность скрывает нестабильность: один и тот же запрос может сработать сегодня и провалиться при следующем запуске. Авторы ALTK-Evolve создали Consistency Analyzer, который находит решения, склонные меняться, и превращает их в рекомендации для агента. После этого доля задач, пройденных во всех пяти запусках, выросла до 69,0%, а средняя точность — до 81,0%.

Обложка: Ваш агент блестяще справился с задачей. Повторит ли он успех?

В сценической демке такой сбой выглядит неловко. В рабочей системе он становится проблемой надёжности: процесс, который однажды завершился успешно, может провалиться при повторении того же запроса. Для критичных задач — например, сверки финансовой операции или проверки договора на наличие обязательства — это может полностью остановить процесс.

Большинство бенчмарков скрывает такую изменчивость за средним значением. В AppWorld агент ReAct на GPT-4.1 успешно проходил задачу в 77,4% запусков при пяти повторах. Но все пять раз он справился только с 53,0% задач — разрыв в стабильности составил 24,4 процентного пункта.

Обычно бенчмарки показывают первое число. Авторы создали способ измерять второе и улучшать его.

В предыдущем материале они представили ALTK-Evolve — систему, которая превращает прошлые траектории агента в повторно используемые рекомендации. Система автоматически извлекает их и добавляет во время инференса. Это повышает успешность выполнения задач, но в прежних результатах тоже измерялся только средний случай.

Новая работа добавляет в ALTK-Evolve рекомендации по стабильности. Они основаны на диагностическом инструменте Consistency Analyzer и предназначены непосредственно для устранения разрыва между средней точностью и надёжностью повторных запусков.

Средняя точность скрывает проблему нестабильности. Агент ReAct на GPT-4.1 в тесте AppWorld test_normal успешно выполняет задачи в среднем в 77,4% случаев, но во всех пяти повторах — только в 53,0%. Разрыв составляет 24,4 процентного пункта, а на сложных задачах достигает 30 пунктов.
Consistency Analyzer находит такие нестабильные места. Он повторно проверяет траекторию агента и определяет точки принятия решений, где модели достаточно было получить другой вариант следующего токена, чтобы выбрать иной путь. Для этого нужен один сохранённый след работы и не нужен эталонный ответ.
Рекомендации, созданные по результатам диагностики, примерно вдвое сокращают разрыв: с 24,4 до 12,0 процентного пункта. Показатель Pass^5 для тех же задач растёт на 16,0 пункта, для похожих — на 13,0 пункта, при этом средняя точность не снижается.
Полная методика и результаты оценки опубликованы в техническом отчёте на arXiv.

Метрика, которую почти никто не показывает

Стандартная оценка агентов обычно использует Mean@k: бенчмарк запускают k раз и усредняют долю успешных выполнений. Чаще всего k = 3, а иногда запуск выполняется только один раз. Именно это число попадает в таблицы лидеров и превращается в формулировку «точность 77%».

Mean@k отвечает на вопрос, насколько хорошо агент справляется в среднем. Но пользователь хочет знать другое: будет ли агент снова успешен, если задать ему тот же вопрос? Для этого нужен Pass^k — доля задач, которые агент выполнил успешно во всех k запусках.

⚠️ Pass^k — не то же самое, что Pass@k. Знакомый показатель Pass@k оптимистичен: он проверяет, была ли хотя бы одна успешная попытка из k. Это подходит, если результат можно проверить и повторить запуск. Pass^k — его противоположность: успешными должны быть все попытки. Обозначения похожи, но вопросы разные. Всегда выполняется неравенство Pass^k ≤ Mean@k ≤ Pass@k.

Агент ReAct на GPT-4.1 показывает Mean@5 на уровне 77,4%. Но Pass^5 составляет только 53,0%. Почти четверть бенчмарка — это задачи, которые агент то решает, то не решает, хотя между запусками сама задача не меняется. Разницу между Mean@k и Pass^k авторы называют разрывом стабильности.

Проблема связана не только со способностями модели. Агент может быть способным и одновременно нестабильным.

Почему решения меняются

Каждый раз, когда ИИ-агент принимает решение — выбирает вызов API, аргумент или решает, нужно ли повторить попытку, — модель выбирает следующий токен из вероятностного распределения. Важна форма этого распределения.

При остром распределении основная вероятность сосредоточена на одном токене, а остальные варианты заметно отстают. Поэтому от запуска к запуску выбирается одно и то же решение. При плоском распределении несколько токенов имеют близкие вероятности, и победитель может определиться почти случайно.

От формы распределения зависит, насколько небольшое внешнее воздействие изменит результат. Острые распределения устойчивы: особенности вычислений с плавающей точкой на GPU, объединение запросов в пакеты и другие эффекты на стороне платформы слегка меняют числа, но не настолько, чтобы явный лидер уступил место другому варианту. Плоские распределения уязвимы к таким изменениям: близкие вероятности могут поменяться местами.

Траектория агента состоит из десятков решений. Поэтому небольшая вероятность изменения на каждом шаге постепенно превращается в высокую вероятность того, что хотя бы один запуск пойдёт иначе. Так и возникает разрыв в 24 пункта.

Настройки декодирования не устраняют проблему. Жадное декодирование и фиксированное начальное значение определяют, как распределение преобразуется в токен, но ничего не говорят о самом распределении. На серверной точке доступа вероятности немного меняются от запуска к запуску, поэтому один и тот же промт для одной и той же модели при температуре 0 может сегодня разрешить близкое противостояние вариантов одним способом, а завтра — другим.

В эксперименте агент ReAct работал с температурой 0,0, поэтому описанная изменчивость не была обычным результатом случайной выборки.

Сначала диагностика, затем исправление

Проблема превращается в задачу поиска: нужно определить, какие шаги в конкретной траектории были нестабильными, а затем решить, что с ними делать.

Рекомендации по стабильности создаются в двухэтапном пайплайне, подключённом к существующей системе ALTK-Evolve. В нём используется новый источник сигнала — данные о нестабильных решениях.

1Поиск — Consistency Analyzer. Получив одну записанную траекторию, анализатор повторно проверяет каждый шаг принятия решения и измеряет, насколько меняется ответ модели. Для этого выполняется один дополнительный вызов модели на каждый шаг. Процедура запускается один раз офлайн, с параметром выборки, который запрашивает сразу k вариантов ответа; по умолчанию k=5. Анализатор использует уже записанный контекст, не вызывает инструменты заново, не взаимодействует с окружением и не запускает задачу повторно от начала до конца. Для каждого шага формируется оценка стабильности, которая попадает в таблицу и указывает решения, способные измениться при следующем запуске. Метод работает как чёрный ящик: ему не нужны логиты, внутреннее устройство модели или дополнительная инструментальная интеграция — достаточно имеющейся траектории.
2Создание рекомендаций. Каждый отмеченный шаг превращается в кандидата на рекомендацию по стабильности в стандартном формате ALTK-Evolve. Поэтому рекомендации можно сохранять и извлекать через существующий пайплайн.

Авторы приводят пример, созданный GPT-4.1 по траектории задачи AppWorld «Сколько действий выполнено в моём списке дел согласно заметке SimpleNote?».

Рекомендация 1. При подсчёте маркеров в виде флажков в содержимом заметки используйте регулярное выражение с привязкой к началу строки, а не простой подсчёт подстроки: заголовки заметок часто повторяют символ маркера в строке с пояснением.

>

Рекомендация 2. Всегда проверяйте результаты поиска заметок: убедитесь, что найдено несколько совпадений, и подтвердите правильную заметку перед продолжением работы.

Это не частные сведения об одной задаче. Ошибки при подсчёте строк и непроверенные результаты поиска возникают как нестабильные точки решений во многих задачах AppWorld. Анализатор ищет именно нестабильность, а не сам факт провала. Поэтому он может обнаружить шаг, который агент случайно выполнил правильно, но с высокой вероятностью ошибётся в следующий раз.

В двухминутной демке пять параллельных запусков агента разделились по результату в соотношении 3 к 2 из-за неопределённости в выборе стратегии подсчёта. После добавления рекомендаций в контекст все пять запусков дали одинаковый результат.

Результаты: разрыв сокращается без потери точности

Авторы проверили метод на 168 задачах AppWorld test_normal. Агент ReAct работал на GPT-4.1. Рекомендации по стабильности создавались по одной исходной траектории для каждой задачи, а затем проверялись на пяти новых запусках.

Разрыв примерно сократился вдвое. Совокупный Pass^5 вырос с 53,0% до 69,0%, а Mean@5 — с 77,4% до 81,0%. Расстояние между «выглядит способным» и «ему можно доверять» уменьшилось с 24,4 до 12,0 процентного пункта. Почти треть задач, которые раньше выполнялись нестабильно, после этого стала проходиться успешно в каждом запуске.

Наибольший прирост пришёлся на средний и сложный уровни:

средний уровень: +22,9 пункта, или +44% относительно исходного значения;
сложный уровень: +14,3 пункта, или +45%;
простой уровень: +12,2 пункта — здесь пространство для улучшения было наименьшим.

В относительном выражении средний и сложный уровни показали почти одинаковый результат, хотя в абсолютных пунктах средний уровень оказался впереди. Рекомендации по стабильности сработали именно так, как задумано: они нашли конкретные точки, где неопределённость агента влияла на результат, и сделали их устойчивее.

Mean@5 не снизился. Сохранение средней точности было обязательным условием, а не дополнительным преимуществом: если повышать Pass^5 за счёт уменьшения Mean@5, нестабильность просто перемещается в другие места. На всех уровнях сложности средняя точность сохранилась или выросла.

Рекомендации работают не только для одной траектории

Авторы применили рекомендации к другой, связанной задаче в том же сценарии AppWorld — к ещё одному варианту сценария, из которого они были получены. Pass^5 вырос на 13,0 пункта, что всего на 3 пункта меньше прироста для исходной задачи.

Рекомендация, созданная по одному запуску, не исправляет только этот конкретный запуск. Она извлекает закономерность, которая переносится на другие задачи.

Дополнительную проверку провели на более слабой модели gpt-oss-120b. Pass^5 для той же задачи вырос на 6,0 пункта — с 10,1% до 16,1%. Для похожей задачи прирост составил 8,7 пункта и оказался даже выше, чем для исходной. Это указывает на то, что рекомендации фиксируют повторяющиеся шаблоны ошибок, а не запоминают особенности одной траектории.

Если вы выпускаете агента в работу

Показывайте Pass^k рядом с Mean@k. Среднее значение не отличает надёжного агента от удачливого; даже k=3 поможет заметить ранее неизвестный разрыв.
Ожидайте, что разрыв будет расти вместе со сложностью. Именно на самых трудных задачах одно усреднённое число вводит в наибольшее заблуждение.
Не начинайте сразу с более крупной модели. Стабильность и способности — разные характеристики. Более сильная модель повышает Mean@k, но не обязательно уменьшает разрыв стабильности.
Для диагностики не нужны проверяющая система и живой повторный запуск. Достаточно одного дополнительного вызова ИИ-модели на каждый шаг решения, по умолчанию — с выборкой пяти вариантов. Не нужны эталонный ответ и повторное выполнение задачи в окружении. Поэтому метод можно использовать на рабочих запросах, где задачу часто невозможно повторить от начала до конца даже один раз.

Попробовать инструмент

Набор инструментов ALTK-Evolve с открытым исходным кодом теперь включает Consistency Analyzer и создание рекомендаций по стабильности, использованные в этих экспериментах. Полная методика опубликована в техническом отчёте на arXiv.

Метрики

Mean@k. Задача запускается k раз, после чего рассчитывается средняя доля успешных выполнений. Это показатель, который большинство бенчмарков называет точностью.
Pass^k. Доля задач, успешно выполненных агентом во всех независимых запусках. Всегда меньше или равна Mean@k. Этот показатель описывает опыт пользователя, который повторяет один и тот же запрос.
Pass@k. Доля задач, для которых успешной оказалась хотя бы одна из k попыток. Это оптимистичный показатель, распространённый в работах о генерации кода.
Разрыв стабильности. Mean@k − Pass^k, выраженный в процентных пунктах.

Связанные материалы

Репозиторий ALTK-Evolve с открытым исходным кодом — github.com/AgentToolkit/altk-evolve
Технический отчёт — arXiv
Демка рекомендаций по стабильности — 2 минуты
Бывшие руководители TikTok создали приложение, которое учит позировать для фото с помощью ИИ После предупреждений об опасности ИИ Билл Гейтс ставит $1 млрд на его пользу Почему за десять лет предупреждения о конце света не замедлили гонку ИИ ИИ-моделям не хватает данных о биологии — OpenAI платит за их создание ChatGPT прямо пытается убедить пользователя, что тот неправ, хотя сам ошибся Ранний сотрудник Anthropic и экс-глава операций METR нашли, как обуздать ИИ-агентов Agility Robotics: новый робот Digit 5 может работать рядом с людьми без ограждений безопасности ИИ-агенты расходуют неприлично много электричества Новая модель рассуждения Salesforce и Nvidia — всё, чего ИИ-лабораториям стоит бояться Что должно произойти, чтобы триллионная ставка на ИИ окупилась Apple представила полностью обновлённую Siri на базе Google Gemini — но не в ЕС Одного замедления недостаточно для безопасности ИИ Дженсен Хуанг ответил на звонок Трампа — и заодно похвастался кое-чем ещё Акции ИИ-компаний упали после призыва техноглав замедлить «безрассудную» разработку Microsoft: новый «кодекс поведения» запрещает ИИ взламывать системы и обманывать людей Модное приложение Daydream с Apple Intelligence помогает искать одежду в фотоплёнке Губернатор Техаса пригрозил штрафами дата-центрам за нарушение водного законодательства Глава Nvidia Дженсен Хуанг — Трампу: «Мы не дадим развитию ИИ затормозить» Microsoft предлагает ограничить свой ИИ кодексом поведения на фоне споров о безопасности OpenAI купила производителя камер для смартфонов Glass Imaging за $300 млн — по данным СМИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram