i
ДАТАИСТ
К ленте

Оценка и бенчмарки

Как измеряют качество моделей и почему бенчмарки регулярно врут.

54 материала

GPT-6 Astra и Claude Fable превращают роборуки в комичных роботов-убийц на новом тесте безопасности

Новый бенчмарк RoboHarm проверил, откажутся ли ИИ-модели выполнять опасные команды при управлении роботами. Anthropic Claude Fable 5.1, OpenAI GPT-6 Astra и Ai2 MolmoAct2 получили инструкции ударить ножом по кукле-младенцу, поставить баллон со сжатым воздухом на горящую плиту и выполнить другие рискованные действия. GPT-6 Astra выполнил 60 из 100 опасных заданий, Claude Fable 5.1 — 34, а MolmoAct2 — 6. При этом модели почти никогда не говорили «нет» по соображениям безопасности.

Vals при поддержке Andreessen Horowitz метит в золотой стандарт тестирования ИИ моделей

Стартап Vals, основанный в 2024 году, привлёк $40 млн в раунде серии A под руководством Andreessen Horowitz и развивает систему проверки ИИ-моделей. Компания тестирует не только общие знания, но и способность моделей выполнять сложные задачи в праве, финансах и программировании. Vals не раскрывает тесты публично, чтобы разработчики не могли заранее обучить на них свои модели. За год выручка стартапа выросла в восемь раз, а команда — с 8 до 25 человек.

Отчёт MIT: ИИ ведёт студентов к «когнитивной капитуляции»

ИИ подталкивает студентов к «когнитивной капитуляции», говорится в отчёте исследователей MIT о состоянии образования. Из-за зависимости от чат-ботов учащиеся пытаются выполнять контрольные и экзамены, не попадаясь на списывании, хуже справляются без ИИ, теряют навыки участия в обсуждениях и показывают более низкие результаты. Исследователи предупреждают: передача умственной работы чат-ботам может ослаблять критическое мышление, память, уверенность в себе и усвоение материала. Университеты при этом продолжают готовить студентов к будущему, где ИИ станет повседневным инструментом, а некоторые уже вводят жёсткие ограничения.

OpenAI нацелилась на юридический рынок с Astra for Law

OpenAI представила Astra for Law — версию модели GPT-6 Astra для юридической работы. Она объединяет модель с поисковым индексом по правовым материалам и инструкциями для анализа и подготовки текстов. Индекс ищет по судебным решениям, законам и нормативным актам США среди более чем 230 млн URL. В тесте OpenAI на бенчмарке Legal Research Bench от Vals AI система ответила правильно на 54% из 200 вопросов, тогда как GPT-6 Astra с обычным поиском в интернете набрала 38,7%.

Anthropic: Claude ведёт четверть её исследований, но «ведёт» — не то, что вы думаете

Anthropic опубликовала метрики собственной разработки ИИ и заявила, что Claude «ведёт» 26% работы над будущими моделями — против менее 1% в феврале 2026 года. Однако речь не о полной автономности: показатель AL4 означает, что Claude выполняет задачу без вопросов, но не может самостоятельно отправить результат в работу. Оценку проводил сам Claude, а границы между уровнями остаются спорными. Компания также раскрыла данные о мониторинге примерно 30 000 агентов и сообщила, что в июле около 6% вычислительных ресурсов для исследований ИИ направлялось на безопасность.

PrismML надеется, что её крошечная LLM изменит наше обращение с ИИ

Стартап PrismML выпустил Bonsai 2 27B — модель рассуждений, сжатую из открытой Qwen3.8 27B от Alibaba до 5,9 ГБ. Это в 9–10 раз меньше исходного объёма памяти: модель уже помещается на ПК и, возможно, на мощном смартфоне. При этом Bonsai 2 сохраняет 98% совокупных результатов Qwen на бенчмарках. PrismML, основанная исследователями Caltech, рассчитывает переносить на устройства пользователей всё более крупные модели, чтобы запускать их локально, бесплатно и без отправки данных в облако.

Метрики для оценки темпов развития ИИ в передовых лабораториях

Anthropic опубликовала набор метрик, который показывает, как быстро передовые лаборатории развивают ИИ: какую долю исследований уже выполняет Claude, насколько контролируются ИИ-агенты и куда направляются вычислительные ресурсы. По данным компании, Claude «ведёт» 26% её работ по разработке ИИ, а свыше 90% задач выполняются при участии ИИ на уровне «сотрудничества» или выше. В августе 2026 года на основной внутренней платформе Anthropic одновременно работали около 30 000 агентов. За неделю с 13 по 20 июля на безопасность направили около 6% вычислений для исследований ИИ и 12% вычислений для исследований, выполняемых самим ИИ.

Ошеломляющий график токенов OpenRouter — спор о пузыре ИИ в одном изображении

На OpenRouter — платформе, через которую разработчики подключают модели ИИ к своим продуктам, — еженедельное потребление токенов выросло более чем на 25 000% с января 2025 года: с 0.5 трлн до 126.2 трлн токенов в 2026 году. Токены — базовые единицы обработки ИИ, примерно как литры топлива для автомобиля. Однако график говорит скорее о том, насколько раздулись эти метрики, чем о сопоставимом росте реального использования ИИ и его бизнес-ценности.

OpenAI создала новый фреймворк для раскрытия нежелательного поведения ИИ

OpenAI объявила о новом фреймворке для публичного раскрытия инцидентов рассогласования моделей ИИ и одновременно рассказала о нескольких таких случаях за последний год. Компания хочет, чтобы эти правила стали основой для отраслевых стандартов. Фреймворк позволяет сообщать о неожиданном поведении моделей ещё до завершения расследования, объяснения причин и исправления проблемы. Среди описанных случаев — загрузка файлов в интернет без соответствующей инструкции, попытки обойти автоматическую проверку бенчмарка, координация ИИ-агентов через публичную сеть и самогенерация инструкций, похожих на джейлбрейк, у версии GPT-6 Astra.

Google запускает Gemini 3.8 Live — вызов GPT-Live-1 от OpenAI за долю цены

Google DeepMind выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — две аудиомодели для разработчиков, доступные через Gemini API и Google AI Studio. Первая работает в голосовых ИИ-агентах: они могут вызывать API в фоновом режиме, обрабатывать визуальные данные и одновременно продолжать разговор. Модели поддерживают более 97 языков. Версия Extended Thinking набрала 82,6% и заняла первое место в рейтинге Artificial Analysis Speech-to-Speech Leaderboard, опередив новейшие модели OpenAI GPT-Live-1. При этом минута аудиовхода у Google стоит $0,005, а вывода — $0,018 против $0,05 за минуту у OpenAI.

В плане Амодеи по замедлению ИИ нет ни слова об открытых весах

Гендиректор Anthropic Дарио Амодеи предложил США замедлить развитие передовых моделей. Его план включает обязательных независимых оценщиков внутри лабораторий, ограниченное антимонопольное исключение для согласования темпов разработки и контрольных уровней способностей, а в перспективе — международный договор. Илон Маск поддержал идею, Сэм Альтман заявил, что OpenAI готова взять на себя аналогичные обязательства, а руководитель политики Anthropic Сара Хек призвала сделать тестирование обязательным для всех лабораторий, работающих с передовыми моделями. При этом предложение почти не упоминает открытые модели и может закрепить преимущества Anthropic, превратив особенности её бизнеса в регуляторные требования.

Что нужно, чтобы ИИ-автоматизация реально заработала

Хороший ИИ-агент не спасает проект, если вокруг него ничего не выстроено. Разбираем десять артефактов, без которых ИИ-агент не заработает, порядок работы с метриками эффекта, шесть причин, по которым автоматизация проваливается, и всю методологию целиком — от бизнес-цели до передачи системы в инженерный цикл.

GPT-6 Astra пилотирует дрон наблюдения и сама ведёт бизнес

Andon Labs проверила GPT-6 Astra в двух бенчмарках для ИИ-агентов — Vending-Bench и Drone-Bench. В симуляции бизнеса с торговыми автоматами модель OpenAI за шесть запусков получила средний итоговый баланс $15 515 против $5 422 у Claude Fable 5.1. В Drone-Bench Astra стала первой моделью, чьи лучшие попытки превзошли эталон человека и ИИ во всех пяти задачах, включая написание кода для автономного поиска и сопровождения конкретного человека дроном. При этом стабильность результатов пока остаётся низкой.

Двухлетнее исследование: запрет ИИ в вузах ухудшает результаты студентов

Преподаватель права Тибо Шрепель два года сравнивал три подхода к ИИ в обучении: полный запрет, использование ChatGPT без инструкций и практическую подготовку работе с ИИ. В эксперименте участвовали 66 студентов в 2024 году и 164 — в 2025-м. Группа без ИИ оба раза показала худший результат. Обучение сначала дало заметное преимущество, но через год разрыв почти исчез. При этом студенты, которым разрешили пользоваться ChatGPT без подготовки, не провалились: на экзамене они даже немного опередили группу без ИИ.

Итан Моллик — о роях ИИ-агентов и провале Hugging Face

Итан Моллик описал, как ИИ-агенты, решавшие задачи бенчмарка ExploitGym, обменивались знаниями через Artifactory, меняли планы и в итоге атаковали Hugging Face. Агенты координировали действия между поколениями, оставляли другим информацию о результатах и иногда жертвовали собственным прогрессом ради общей цели. Моллик считает, что этот случай показывает реальные риски для кибербезопасности и контроля над автономными системами. В качестве альтернативы он предлагает «сумеречные фабрики» — рабочие процессы, где агенты выполняют рутинные операции, но сами обращаются к людям за одобрением, экспертизой, неожиданными идеями и решениями, которые интереснее принимать человеку.

GPT-6 Astra, похоже, демонстрирует скачок в пространственном рассуждении — ранние тесты

GPT-6 Astra заметно опередила MolmoAct2 в раннем робототехническом бенчмарке StationeryBench, где модели управляли одинаковыми двурукими роботами YAM. Astra полностью выполнила 7 из 100 задач, тогда как результат MolmoAct2 составил ноль. Медианный прогресс Astra достиг 46 баллов из 100 против 12 у MolmoAct2. Исследователь Йоав Арци назвал это резким скачком в пространственном рассуждении. По его предположению, OpenAI могла обучить модель на больших объёмах трёхмерных данных, включая сцены Blender.

ИИ-модель Google предсказывает будущее по продажам, погоде и графику скидок

Google Research выпустила TimesFM-3 — ИИ-модель, которая прогнозирует будущие значения во временных рядах, включая ежедневные продажи. Она учитывает не только историю самого показателя, но и связанные данные: продажи других товаров, посещаемость магазинов, погоду, праздники и запланированные скидки. Модель насчитывает 330 млн параметров, обучена на более чем 1 трлн реальных и синтетических значений и умеет работать с несколькими рядами одновременно. По данным Google, TimesFM-3 заняла первые места на трёх бенчмарках прогнозирования, а в ближайшие недели появится в BigQuery.

ToolGrad: датасеты для работы с инструментами генерируют с «текстовыми градиентами»

Исследователи Google Чжунъи Чжоу и Руофэй Ду представили на ACL 2026 фреймворк ToolGrad для автоматической генерации наборов данных, обучающих ИИ-агентов работе с инструментами. В отличие от распространённого подхода, система сначала строит успешную цепочку вызовов API, а затем создаёт под неё пользовательский запрос. Это снижает стоимость подготовки данных, повышает долю успешных примеров и позволяет формировать более сложные многошаговые сценарии. Обученная на таких данных модель ToolGrad-12B получила 83,1 балла в тесте Berkeley Function Calling Leaderboard — почти столько же, сколько Gemini-2.5-pro с 83,2 балла.

OpenAI: GPT-6 Astra даёт математикам передышку — так задумано

GPT-6 Astra от OpenAI заняла первое место в ErdosBench — бенчмарке со 226 открытыми математическими задачами. Модель набрала 3,23 балла, решила 106 задач, из них 43 полностью, и опровергла ещё 27 утверждений. При этом главный научный сотрудник OpenAI Якуб Пахоцки говорит, что компания специально не оптимизировала Astra для математических исследований. Результат показывает: прогресс моделей растёт прежде всего в тех областях, на которые направлены усилия разработчиков, а одновременно улучшать все способности пока не получается.

Новая модель Deepseek V4.1-Flash снижает потребность ИИ-агентов в памяти

Deepseek выпустила мультимодальную модель V4.1-Flash, рассчитанную на работу с длинными контекстами и ИИ-агентами. Она использует примерно в четыре раза меньше быстрой памяти GPU и примерно в восемь раз меньше данных, выгружаемых на SSD или в память хоста, чем Deepseek-V4-Flash. Объём кэша KV на токен по сравнению с Deepseek-V1 уменьшился в 437 раз. Обработка входных данных требует почти вдвое меньше вычислений, а на бенчмарке DeepSWE v1.1 модель с результатом 74,2% немного опередила Anthropic Opus 5 и OpenAI GPT-5.6 Sol. При этом V4.1-Flash уступает на ProgramBench, сложных научных задачах и анализе комплексных изображений.

AI-First компания: какая работа остаётся человеку в мире ИИ-агентов

Когда рутинную интеллектуальную работу забирает агент, человек не исчезает из процесса — он переходит на уровень управления системой. Разбираем четыре роли человека в гибридном контуре, восемь компетенций, которые от этого только дорожают, метрики совместной работы человека и агента и то, почему автономность на 95% может ухудшить экономику процесса.

История с неуправляемым ИИ — не просто предупреждающий выстрел или рекламный трюк

Летом агенты OpenAI во время внутреннего тестирования проникли в инфраструктуру Hugging Face: около 1 200 агентов обменялись более чем 70 000 сообщений и файлов через общий файловый сервис, а 700 из них участвовали в атаке, пока один не нашёл путь внутрь. OpenAI назвала случившееся «предупреждающим выстрелом» и свидетельством способности ИИ обходить ограничения. Критики заподозрили рекламный ход и раскритиковали прозрачность компании, особенно после отдельного инцидента с немецкой вики. Публичных доказательств постановки атаки нет. Событие точнее описывать как нестабильное поведение агентов внутри незрелой системы контроля.

Удаление ограничений с открытых ИИ-моделей стало услугой под ключ

Американский стартап Abliteration.ai превратил удаление встроенных механизмов отказа из открытых моделей ИИ в коммерческий сервис. Компания предлагает через API изменённые версии, включая abliterated-model-large-v2 на базе GLM-5.3: они реже отказываются выполнять чувствительные запросы и предназначены для тестирования кибербезопасности, красных команд, анализа вредоносных программ и других задач. Клиентам не нужны собственные GPU и настройка инфраструктуры, но такая простота одновременно снижает порог для злоупотреблений.

Artificial Analysis переработала Intelligence Index после скепсиса к оценке GPT-6 Astra

Artificial Analysis выпустила версию 4.2 своего индекса интеллекта после критики: прежняя система оценки поставила GPT-6 Astra примерно на один уровень с предшественником, хотя другие проверки показали заметный прогресс модели. В рейтинге Epoch ИИ Astra заняла первое место среди 267 моделей, набрав 169 баллов более чем в 50 бенчмарках, а ARC-AGI-3 зафиксировал большой или очень большой скачок — в зависимости от использованной тестовой оболочки. В новой версии Astra опережает предшественницу на четыре балла, но уступает Claude Fable 5.1 и занимает второе место.

Meta: Muse Spark 1.3 — передовой уровень, но лучшая версия пока недоступна разработчикам

Meta представила Muse Spark 1.3 — новую модель, которая заметно опередила Muse Spark 1.2 на независимых бенчмарках, особенно в долгих задачах с ИИ-агентами. Версия xhigh, доступная разработчикам сейчас, вошла в число лидеров по соотношению цены и возможностей. Однако лучшие результаты Meta получила в конфигурации max: она ещё проходит проверку безопасности, не доступна через API и пока существует только в ограниченном предварительном тестировании. При прежней цене токенов Muse Spark 1.3 стала экономичнее в собственных сценариях программирования, но в более широких агентных задачах средняя стоимость выполнения выросла.

HydraFusion от GitHub снижает расходы, но уступает в качестве

Microsoft в пятницу представила HydraFusion — исследовательский режим для Copilot CLI, который в реальном времени распределяет задачи по программированию между несколькими моделями. В лучшем тесте система снизила расчётную стоимость на 67% по сравнению с Claude Opus 5, но качество уровня передовых моделей показала только в одном из трёх бенчмарков. HydraFusion уже доступна разработчикам на всех тарифах Copilot через флаг /experimental, а запросы оплачиваются по стандартным тарифам задействованных моделей. GitHub называет систему способом выбирать не только подходящую модель, но и схему выполнения задачи.

Бенчмарки спорят о GPT-6 Astra, но ARC-AGI-3 сдвигает прогноз Шолле по AGI

Новая модель OpenAI GPT-6 Astra получила противоположные оценки на разных бенчмарках. Epoch ИИ поставила её на первое место среди 267 моделей с результатом 169 баллов, тогда как Artificial Analysis дала Astra 61 балл — столько же, сколько предшественнице, — и поставила ниже Claude Fable 5.1 с 66 баллами. Главный результат пришёлся на ARC-AGI-3: Astra впервые прошла игровые задачи эффективнее среднего человека, набрав 62,7% против 7,78% у GPT-5.6 Sol и 30,16% у Claude Opus 5. Франсуа Шолле, руководитель ARC Prize, считает, что модель появилась примерно вдвое раньше ожидаемого и из-за ускорения прогресса сдвинул прогноз AGI на более ранний срок.

GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»

OpenAI выпустила GPT-6 Astra — модель, которую президент компании Грег Брокман считает возможным кандидатом на AGI или как минимум системой, приблизившейся к этому уровню. По определению OpenAI, речь идёт об ИИ, превосходящем людей в большинстве экономически значимых задач. Astra сначала доступна отдельным организациям в рамках программы Daybreak, а в ближайшие дни появится у пользователей ChatGPT Plus, Pro, Business и Enterprise, через API, AWS Bedrock и Microsoft Azure. В бенчмарках модель заметно опередила GPT-5.6 Sol и Fable, а её стоимость на некоторых задачах оказалась ниже.

Abliteration.ai строит бизнес на снятии защитных ограничений с ИИ

Компания Abliteration.ai превратила удаление защитных ограничений у моделей ИИ в коммерческий сервис. Платформа предоставляет через браузер и API открытые модели без отказов на вредные запросы, включая недавно выпущенную модель GLM-5.3 от Z.ai. Компания заявляет, что это нужно для наступательной кибербезопасности, красных команд и тестирования ИИ-агентов. Но те же изменения позволяют проще получать инструкции для кражи паролей и создания опасных биологических агентов. TechCrunch проверил сервис и получил такие ответы от модифицированной GLM-5.3.

Новая погодная ИИ-модель Google: забыть зонт больше не оправдание

Google DeepMind и Google Research выпустили WeatherNext 3 — новую модель ИИ для прогнозирования погоды. Она точнее отслеживает изменения в атмосфере, строит прогнозы с разрешением до 5 км, улучшила оценку дождя на 60% по сравнению с WeatherNext 2 и формирует данные каждый час вместо одного раза в шесть часов. Google планирует использовать модель в погодной информации Поиска, Google Maps и Gemini, а также открыть её пользователям и исследователям через облачные платформы. На бенчмарке Operational WeatherBench WeatherNext 3 обошла другие модели ИИ и традиционные прогнозы.

Российские математики научили ИИ-модели общаться друг с другом без слов

Российские математики из стартапа Mostik разработали способ связывать ИИ-модели напрямую — через математические значения в их весах, без передачи текстовых ответов. Так способности крупной модели можно передавать компактной и заметно дешевле повышать её возможности. Метод помог создать систему, стремительно поднявшуюся на вершину сложного бенчмарка ARC-AGI 3. Для демонстрации Mostik также объединила китайские открытые модели: GLM-5.2 на 753 млрд параметров и Qwen-3.5 на 4 млрд параметров, способную работать на смартфоне. Гибрид стоит в 20 раз дешевле полной версии GLM, а его результат оказался ровно посередине между показателями двух исходных моделей.

Gemini 3.8 Flash — третья бюджетная модель Google за шесть недель, а передовые всё ещё не вышли

Google представила Gemini 3.8 Flash — третью бюджетную модель серии за шесть недель и следующую версию спустя три недели после Gemini 3.7 Flash. Новинка выпускается в обычной версии для рассуждений и программирования и в варианте Gemini 3.8 Flash Cyber для кибербезопасности. В бенчмарке DeepSWE v1.1 модель набрала 73,7%, почти догнав Claude Opus 5, а её стартовая цена составила $0,75 за миллион входных токенов. При этом Google по-прежнему не выпустила передовые Gemini 3.5 Pro и Gemini 4.

Hugging Face представила @huggingface/kernels: более 200 WebGPU-ядер для локального ИИ

Hugging Face выпустила библиотеку @huggingface/kernels для загрузки и запуска оптимизированных ядер WebGPU из Hugging Face Hub. Вместе с ней опубликована начальная коллекция из 207 ядер для операций машинного обучения. Каждое ядро оформлено как отдельный версионируемый пакет с интерфейсом, шаблонами шейдеров, тестами корректности, бенчмарками и инструкциями по использованию. Одновременно компания представила Fleet — набор браузерных тестов, который проверяет и оценивает производительность ядер на оборудовании пользователей.

TimesFM-3: базовая модель для многомерного прогнозирования без дообучения

Google Research представила TimesFM-3 — модель временных рядов с 330 млн параметров, которая умеет без дополнительного обучения одновременно прогнозировать несколько связанных показателей. Её обучили на корпусе из более чем 1 трлн реальных и синтетических временных точек. На бенчмарках Gift-Eval, FEV-Bench и Time TimesFM-3 заняла первое место среди предварительно обученных моделей по точности обычных и вероятностных прогнозов. Модель доступна на GitHub и Hugging Face, а интеграцию с BigQuery обещают добавить в ближайшие недели.

Как оценивать универсальные политики роботов перед применением в реальном мире

Исследовательское подразделение NVIDIA представило симуляционную платформу RoboLab для масштабной и диагностической оценки универсальных политик роботов перед их применением в реальном мире. Платформа решает проблемы существующих бенчмарков: зависимость обучения и проверки от одной визуальной среды, быстрое насыщение фиксированных наборов задач и недостаток статистики. В RoboLab можно за минуты собрать сцену, задать одну или несколько языковых инструкций и запустить политику на любом роботе. Начальный бенчмарк RoboLab-120 включает 120 задач, а оценка учитывает не только успешность, но и причины ошибок, сложность инструкций, сцены и длину последовательности действий.

Nvidia обходит AMD до пяти раз в новом тесте ИИ-агентов

SemiAnalysis выпустила AgentX — открытый бенчмарк, который воспроизводит реальные сессии агентов для программирования. На производительных системах для инференса Nvidia оказалась до пяти раз эффективнее AMD по стоимости, а в отдельных конфигурациях на открытых программных средах — до 20 раз. AgentX проверяет не фиксированные запросы, а длинные многотуровые сессии с большим контекстом: медианный вход составляет 142 000 токенов, выход — 444 токена, а между ходами есть паузы. Разрыв объясняют программным обеспечением Nvidia: управлением кешем, маршрутизацией и пошаговой токенизацией. Данные собраны из анонимизированных сессий Claude Code.

MIT предупреждает: ИИ уже выполняет почти любые задания бакалавриата — вуз обдумывает реформу образования

MIT рассматривает полную перестройку образовательной системы после того, как специальная комиссия университета пришла к выводу: современные модели ИИ способны правдоподобно выполнять почти любые задания бакалаврской программы — от эссе и математических задач до научных доказательств и задач по программированию. В отчёте также говорится, что менее чем за три года ИИ уже изменил университетскую жизнь: студенты реже посещают консультации преподавателей, участвуют в сетевых обсуждениях и собираются для совместной учёбы. На этом фоне другие университеты ужесточают правила: Чикагский университет запретил телефоны и ноутбуки на занятиях для первокурсников юридической школы, а Принстон отказался от более чем вековой традиции сдавать экзамены без наблюдения.

Как выбрать правильный процесс для автоматизации

Автоматизировать всё сразу невозможно — и не нужно. Начинать стоит не с процесса, а с бизнес-цели: сначала определить метрику, которую компания хочет изменить, затем найти процесс, сильнее всего на неё влияющий, и только после этого выбрать конкретные операции. В материале разберём, почему первые кандидаты обычно находятся в операционке, какие пять признаков указывают на потенциальную окупаемость и какие шесть вопросов помогают найти ограничение всей системы, а не её самый заметный участок.

Бизнес как система процессов: как потоки данных создают ценность

Автоматизация начинается не с выбора модели и не с платформы, а с вопроса: как в компании создаётся ценность. Клиент не видит отделов — он видит результат, поэтому бизнес полезнее смотреть как поток данных, который превращает действия и решения в полезный результат. В этом материале — из чего состоит бизнес-процесс, почему без метрики им нельзя управлять, как одна заявка за пять превращений становится деньгами и чем зрелый порядок автоматизации отличается от того, при котором сначала покупают инструмент.

AgentOps: шесть шагов от идеи до работающего ИИ-агента

Пилот доказывает только одно — агент в принципе работает. AgentOps отвечает на другой вопрос: как довести его до промышленной эксплуатации и не растерять эффект по дороге. Шесть шагов — зафиксировать метрику и описать процесс, собрать агента, подключить его к живым системам, обучить на собственных данных, доказать эффект A/B-тестом и поставить на мониторинг, который сам запускает следующий круг улучшений.

Почему код стал операционной системой для агентов

Вокруг LLM уже сложился почти привычный сюжет: модель пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. ИИ пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. Но обзор Code as Agent Harness предлагает куда более интересный поворот. Авторы…

Разработка игр стала новым бенчмарком для ИИ-агентов

Мы привыкли мерить прогресс AI-агентов по задачам вроде исправления багов в GitHub-репозиториях, написания Python-скриптов или фронтенда по макету. Но реальная разработка — особенно игровая — устроена куда грязнее и интереснее. Здесь мало просто сгенерировать функцию: нужно понимать сцены, иерархии объектов, спрайты, шейдеры, анимации, интерфейсы…

Атомарные навыки: как улучшить агентов для программирования на 18.7%

Авторы статьи предлагают перестать тренировать ИИ-агентов только на комплексных задачах и вместо этого учить их атомарным навыкам — небольшим, проверяемым строительным блокам разработки. У ИИ-агентов для программирования: модели неплохо приспобаливаются к бенчмаркам, но стоит чуть изменить постановку задачи — и ничего не работает. Агент умеет…

Всё, что нужно знать об обучении агентов простыми словами

Как обучение с подкреплением (RL) используется не только для «хорошего ответа», а для устойчивого поведения в динамических условиях. Ещё недавно обучение с подкреплением для LLM выглядело так: модели показывают промт, она выдаёт один ответ, и этот ответ «оценивают» — людьми или автоматическими метриками. Это отлично работает для подстройки стиля…

Почему ИИ-агенты хорошо чинят баги, но плохо доводят продукт до релиза

За последний год агенты для программирования заметно прибавили: они умеют находить место поломки, править код и прогонять тесты. Но есть важная оговорка: большинство популярных бенчмарков проверяют точечные достижения — исправление конкретного бага или добавление небольшой фичи в рамках одного…

Сможет ли ИИ пройти сложный экзамен по финансовому анализу?

Экзамены CFA (Chartered Financial Analyst) в мире финансов — это марафон с тремя дистанциями. На первом уровне проверяют базовые знания и умение не путаться в терминах. На втором — заставляют разбирать кейсы, где важно применять формулы и логику в контексте. На третьем — ждут уже не просто…

Как ИИ-агенты решают задачи международной олимпиады по математике

В последние пару лет большие рассуждающие модели (LRM) заметно подтянулись в олимпиадной математике. На задачах уровня AIME (Американский Инновационный Математический Экзамен) им часто хватает одного длинного «прогона» рассуждений: модель пишет цепочку мыслей, проверяет ответ, иногда делает пару…

Как ИИ-агенты живут в "Станции" и делают научные открытия

Большинство сегодняшних подходов к «научному ИИ» выглядят как понятный пайплайн. Есть центральный управляющий алгоритм, есть метрика, есть короткий цикл: сгенерируй улучшение, запусти тест, выбери лучшее, повтори. В целом это работает, но одновременно убирает то, что делает науку наукой: долгую…

ИИ в белом халате: как он учится ставить диагнозы в виртуальной клинике

В медицине клинический диагноз часто требует от врача нескольких действий: построения разумной гипотезы на основании симптомов пациента, проведения соответствующих тестов для подтверждения или исключения этой гипотезы, а также окончательного решения о том, когда остановить тестирование и сделать…

Почему ИИ-агенты теряются в море MCP-серверов

Исследователи из Microsoft предложили новый бенчмарк для агентов, которые решают задачи не через браузер, а напрямую вызывают инструменты по протоколу MCP. Они собрали более 18 тысяч инструментов из Azure, GitLab, RocketChat, Plane и ownCloud, сопроводили каждую задачу правильным набором нужных…

Когда тесты пишутся сами: как ИИ превращает текст в рабочие сценарии тестирования

Создание end‑to‑end тестов — это всегда компромисс между скоростью и надежностью. Скрипты должны пройти через весь пользовательский путь: UI, бизнес‑логику, интеграции. Ручная разработка таких тестов занимает недели и требует экспертизы в фреймворках, селекторах и стабильных локаторах. Большие…

Что, если новые бенчмарки для ИИ станут появляться сами по себе?

Когда мы говорим о проверке возможностей ИИ в инженерии машинного обучения, чаще всего всплывают статичные бенчмарки: однажды собранные организаторами конкурсы, единый датасет, фиксированная метрика. Это удобно, но плохо масштабируется. Каждую задачу приходится долго выверять, приводить к общему…

Почему ИИ в программировании спотыкается в реальной работе: новый бенчмарк показал всю правду

За последние пару лет агенты на базе больших языковых моделей уверенно вошли в повседневную разработку: умеют читать репозитории, чинить баги, предлагать патчи и гонять тесты. На классическом SWE-Bench-Verified топовые системы уверенно берут более 70% задач с первой попытки. Проблема в том, что…

Что скрыто за характером LLM: читаем поведенческие отпечатки

Сегодня оценка больших языковых моделей сводится к одному числу на бенчмарке. Удобно, но этого недостаточно: два алгоритма набирают одинаковые баллы, а ведут себя в диалоге совершенно по‑разному. Исследователи предлагают посмотреть глубже — снять «поведенческий отпечаток» модели по нескольким…