i
Новости
Новости · 2026-09-20

Gander от Tencent стремится не замолкать, работая в фоне

@neuronium_ai @neuronium_ai

Tencent представила исследовательскую модель Gander, которая одновременно разговаривает с пользователем и выполняет сложные задачи в фоне. Модель обрабатывает речь, изображения и текст, может слушать и говорить одновременно, принимать перебивания в любой момент, задавать уточняющие вопросы и сообщать о ходе работы. В архитектуре Gander разговором управляет быстрый «мозжечок», а отдельный «мозг» решает более сложные задачи. На тестах модель реже перебивала пользователей, чем конкуренты, но уступила им по точности выполнения задач и показала слабые результаты в понимании видео и аудио. Tencent планирует открыть веса и данные обучения, а код уже доступен на GitHub.

Обложка: Gander от Tencent стремится не замолкать, работая в фоне

Как работает Gander

Исследователи команды Hunyuan Speech в Tencent и нескольких университетов представили Gander как ИИ-модель, способную поддерживать разговор во время выполнения сложных задач. Согласно техническому отчёту, она одновременно принимает речь, изображения и текст.

Авторы отмечают, что современные голосовые помощники в основном общаются по очереди с пользователем. В обычном разговоре люди перебивают друг друга, быстро реагируют на сказанное и могут слушать собеседника, пока сами говорят. Gander должна поддерживать такой обмен: она непрерывно обрабатывает видео, речь и текст даже во время собственного ответа. Пользователь может вмешаться в любой момент, а модель — задать уточняющий вопрос или сообщить о ходе выполнения задачи без отдельной команды.

Разговор продолжается, пока «мозг» работает

Быстрый диалог требует коротких ответов, а поиск файлов или написание кода — времени на планирование. По мнению исследователей, одной модели приходится выбирать между скоростью и способностью к рассуждению, поэтому Gander разделяет эти функции.

Архитектура получила названия по аналогии с анатомией человека:

«Мозжечок» отвечает за разговор в реальном времени.
«Мозг» занимается рассуждением и сложными задачами в фоне.

«Мозг» можно заменить агентскими системами вроде Codex или Claude Code, не переобучая разговорную модель. В тестах эту роль выполняла не названная в отчёте модель из семейства OpenAI GPT-5.6. По мере улучшения базовой модели должна улучшаться и вся система.

Пока фоновый агент исправляет ошибку, пользователь может продолжать задавать вопросы и добавлять в задачу совместимость с Python 3.12

Пока фоновый агент исправляет ошибку, пользователь может продолжать задавать вопросы и добавлять в задачу совместимость с Python 3.12

Источник: the-decoder.com

Точность тайминга и задач

Gander делит разговор на отрезки по одной секунде. За это время «мозжечок» решает, нужно ли слушать, начинать говорить или остановиться, если пользователь перебил модель. Отдельный модуль для определения начала и конца речи не используется: модель хранит примерно последние две минуты разговора и опирается на этот контекст.

Поскольку отдельного бенчмарка для таких систем пока нет, исследователи использовали существующие тесты. В отчёте говорится, что на Full-Duplex-Bench v3, где голосовые помощники проверяют в разных сценариях, Gander показала лучший результат по таймингу.

Модель начинала говорить в подходящий момент во всех 100 сценариях. Пользователей она перебивала в 8% случаев — против 13,5% у GPT-Realtime и почти 48% у самого слабого конкурента. По данным отчёта, Gander использует сравнительно небольшую модель, но соперничает с коммерческими системами, включая GPT-Realtime, Gemini Live и Grok.

100сценариев с правильным началом ответа
8%перебиваний Gander
13,5%перебиваний GPT-Realtime
почти 48%перебиваний самого слабого конкурента
Gander реже прерывает пользователей, чем любая другая протестированная система, но точность выполнения задач у него немного ниже, чем у самого слабого конкурента

Gander реже прерывает пользователей, чем любая другая протестированная система, но точность выполнения задач у него немного ниже, чем у самого слабого конкурента

Источник: the-decoder.com

По точности выполнения задач Gander немного отстаёт. Исследователи связывают это отчасти с методикой теста: оценивается вся система целиком, поэтому ошибки распознавания речи и формирования ответа снижают общий результат. Когда «мозгу» напрямую передают текст, он набирает гораздо больше баллов.

Понимание видео и аудио также оказалось слабее. В одном из тестов Gander выступила хуже базовой модели. Исследователи объясняют это обучением, ориентированным прежде всего на плавный разговор, а не на точное восприятие. К таким задачам относятся подсчёт объектов и определение их положения на изображении.

Tencent откроет веса и данные обучения

Согласно отчёту, Gander обучали примерно на 2,7 млн примеров. Часть из них учит модель молчать, если вокруг есть фоновый шум или никто в группе не обращается к ней.

Исследователи считают, что работа находится на ранней стадии. Пока неизвестно, как масштабировать Gander, а стандартного способа оценивать такие системы ещё нет.

Команда планирует опубликовать веса и данные обучения после завершения «процесса открытия исходного кода». Репозиторий с кодом уже появился на GitHub; на странице проекта размещены демки.

Компании разделяют задачи между моделями

Gander появилась после июльского выпуска Tencent — открытой языковой модели Hy3, которая, как сообщалось, сократила отставание от конкурентов, особенно в задачах для ИИ-агентов. Hy3 уже работает в WorkBuddy, Yuanbao и WeChat.

Кроме того, Tencent ведёт переговоры о покупке крупнейшей доли в стартапе Manus, занимающемся ИИ-агентами. Это происходит после того, как Пекин заблокировал приобретение Manus компанией Meta. Tencent считает сделку подходящей для собственных планов, включая ИИ-агента, встроенного в WeChat.

Другие компании используют оркестраторы, которые распределяют задачи между разными моделями:

OpenAI GPT-Live отделяет разговор от рассуждения: веб-поиск и задачи ИИ-агента передаются фоновой модели, пока диалог продолжается.
Fugu от Sakana AI — отдельная языковая модель, вызывающая другие модели из расширяемого набора.
OpenAI также тестирует проактивных ИИ-агентов, которые сами создают последующие задачи и связываются с пользователями без запроса.

Обработка перебиваний и задержки остаются практическими проблемами. Анализ Anthropic показал, что опытные пользователи перебивают Claude Code примерно в 9% рабочих шагов, а новички — примерно в 5%. Команды, создающие голосовых и текстовых ИИ-агентов для общения, особенно часто сообщают о проблемах с задержкой, говорится в обзоре.

Источник: the-decoder.com

Британский стартап привлёк $20 млн, чтобы воссоздавать концерты с «гиперреалистичными» цифровыми аватарами Федеральный реестр США уличили в использовании китайской ИИ-модели для поиска документов Крупнейший просчёт Трампа? Как один советник направил грандиозную панику вокруг ИИ Цифровые ученики с реалистичными ошибками помогают ИИ-репетиторам учиться быстрее Белый дом прикрывает ИИ-бум, семья Трампа и союзники богатеют — почти без ограничений Runway хочет превратить генерацию видео с ИИ в управляемую трансляцию в реальном времени Призывы замедлить развитие ИИ оправданны, но крах пузыря может стать более близкой угрозой Muse от Meta лучше следит за мной, чем помогает Вслед за OpenAI Anthropic, по сообщениям, тоже переносит IPO Ежедневное использование ИИ в США за полгода выросло более чем вдвое Почему Китай не соглашается с предупреждениями США о стремительном развитии ИИ Всё больше австралийцев доживут до 90 с лишним лет — продолжительность жизни вырастет Корпоративный код и процессы — на естественном языке? G5 Labs считает: G5 всё сделает Какая ИИ-модель лучше для дизайна, видео и липсинка? OpenArt Arena ранжирует модели по задачам Salesforce: ИИ-агент выполняет 93% браузерных задач вместо 43,5% без изменений модели Anthropic сворачивает Claude Cowork в чат Claude и запускает Claude Docs и Claude Slides Microsoft выпустила новый ИИ-плейбук для бизнеса: неожиданный «ров» уже может быть у вас Трамп создаст «ИИ-силы» для контроля ИИ на фоне страха перед неуправляемыми агентами Anthropic запустила Claude Code Projects — «всегда на связи» помнит и распределяет долгую разработку Австралия почти не подготовилась к угрозам ИИ. Где блестящее руководство, когда нужно?

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram