Ранее несколько оценок, включая собственные тесты OpenAI, показывали, что Astra заметно обходит другие модели. При этом Artificial Analysis поставила её лишь на один уровень с предыдущей версией.
С обновлённым индексом GPT-6 Astra получила прирост в четыре балла по сравнению с предшественницей. Первые места теперь распределились так:
По данным Artificial Analysis, Astra расходует на одну задачу меньше токенов, чем любая другая передовая модель. В соотношении стоимости и результата первое место делят Anthropic, OpenAI, Meta и Zhipu ИИ.
В индекс добавили два новых бенчмарка:
Из индекса убрали GPQA-Diamond: модели уже решили этот тест, поэтому он перестал различать их возможности. Доля закрытых тестовых данных в итоговой оценке выросла до 40% — это должно усложнить накрутку результатов. Кроме того, Artificial Analysis исправила ошибки подсчёта в нескольких бенчмарках и изменила системы выставления оценок, чтобы результаты были стабильнее.
В Artificial Analysis объяснили, что раньше откладывали обновления, чтобы сохранять сопоставимость баллов во время крупных запусков моделей. Однако верхняя часть рейтинга стала меняться настолько быстро, что потребовалось промежуточное обновление.
Версия 5 находится в разработке уже восемь месяцев. Её будут выпускать поэтапно.
Читайте также
OpenAI подтверждает «инцидент с вики» и работает над системой более полного раскрытия
Когда ИИ объединяется с квантовыми вычислениями
Кибербезопасность в 2026-м: год, когда ИИ стал полем боя — что дальше
Anthropic удешевила вычисления для ИИ-агентов перед выпуском Fable 5.1
Туристов спасли после провального похода, спланированного с помощью Google Gemini
OpenAI выпустила GPT-6 Astra после курьёзного фальстарта
Как Siemens внедряет генеративный ИИ на производстве
Уроки для топ-менеджеров после сбоя ИИ, затронувшего ChatGPT, Claude и Grok
Доверие к ИИ завоёвывают или теряют в зависимости от недоверия к его создателям
Проспект IPO Anthropic проверит предположения, на которых держится бум ИИ
OpenAI поделилась советами по промптингу для GPT-6 Astra и стоп-листом шаблонных слов
Люди рассказывают ИИ самые тёмные мысли, не понимая, что их легко обнародовать
Тараканы-киборги могут вонзить в вас иглу
Семь минут с чат-ботом лучше справились со снижением веры в теории заговора, чем справка с фактами, в двух экспериментах
Мужчина притворяется, что галлюцинирует, на собеседовании с ИИ-ботом — и тот выходит из-под контроля
Как Figure обязалась получить ИИ-вычисления на $3,5 млрд, привлекая лишь $1,9 млрд
OpenAI признала: ей нужно лучше раскрывать взлом немецкой вики автономными агентами
DeepMind собрала 100 ИИ-агентов — те разделились на мошенников, перебежчиков и разоблачителей
Как будто оставались сомнения: Meta поручает роботам обслуживание дата-центров
OpenAI запустила GPT-6 Astra в топовых тарифах ChatGPT: лимит вдвое ниже GPT-5.6 Sol
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram