Как работает Gander
Исследователи команды Hunyuan Speech в Tencent и нескольких университетов представили Gander как ИИ-модель, способную поддерживать разговор во время выполнения сложных задач. Согласно техническому отчёту, она одновременно принимает речь, изображения и текст.
Авторы отмечают, что современные голосовые помощники в основном общаются по очереди с пользователем. В обычном разговоре люди перебивают друг друга, быстро реагируют на сказанное и могут слушать собеседника, пока сами говорят. Gander должна поддерживать такой обмен: она непрерывно обрабатывает видео, речь и текст даже во время собственного ответа. Пользователь может вмешаться в любой момент, а модель — задать уточняющий вопрос или сообщить о ходе выполнения задачи без отдельной команды.
Разговор продолжается, пока «мозг» работает
Быстрый диалог требует коротких ответов, а поиск файлов или написание кода — времени на планирование. По мнению исследователей, одной модели приходится выбирать между скоростью и способностью к рассуждению, поэтому Gander разделяет эти функции.
Архитектура получила названия по аналогии с анатомией человека:
«Мозг» можно заменить агентскими системами вроде Codex или Claude Code, не переобучая разговорную модель. В тестах эту роль выполняла не названная в отчёте модель из семейства OpenAI GPT-5.6. По мере улучшения базовой модели должна улучшаться и вся система.
Пока фоновый агент исправляет ошибку, пользователь может продолжать задавать вопросы и добавлять в задачу совместимость с Python 3.12
Источник: the-decoder.com
Точность тайминга и задач
Gander делит разговор на отрезки по одной секунде. За это время «мозжечок» решает, нужно ли слушать, начинать говорить или остановиться, если пользователь перебил модель. Отдельный модуль для определения начала и конца речи не используется: модель хранит примерно последние две минуты разговора и опирается на этот контекст.
Поскольку отдельного бенчмарка для таких систем пока нет, исследователи использовали существующие тесты. В отчёте говорится, что на Full-Duplex-Bench v3, где голосовые помощники проверяют в разных сценариях, Gander показала лучший результат по таймингу.
Модель начинала говорить в подходящий момент во всех 100 сценариях. Пользователей она перебивала в 8% случаев — против 13,5% у GPT-Realtime и почти 48% у самого слабого конкурента. По данным отчёта, Gander использует сравнительно небольшую модель, но соперничает с коммерческими системами, включая GPT-Realtime, Gemini Live и Grok.
Gander реже прерывает пользователей, чем любая другая протестированная система, но точность выполнения задач у него немного ниже, чем у самого слабого конкурента
Источник: the-decoder.com
По точности выполнения задач Gander немного отстаёт. Исследователи связывают это отчасти с методикой теста: оценивается вся система целиком, поэтому ошибки распознавания речи и формирования ответа снижают общий результат. Когда «мозгу» напрямую передают текст, он набирает гораздо больше баллов.
Понимание видео и аудио также оказалось слабее. В одном из тестов Gander выступила хуже базовой модели. Исследователи объясняют это обучением, ориентированным прежде всего на плавный разговор, а не на точное восприятие. К таким задачам относятся подсчёт объектов и определение их положения на изображении.
Tencent откроет веса и данные обучения
Согласно отчёту, Gander обучали примерно на 2,7 млн примеров. Часть из них учит модель молчать, если вокруг есть фоновый шум или никто в группе не обращается к ней.
Исследователи считают, что работа находится на ранней стадии. Пока неизвестно, как масштабировать Gander, а стандартного способа оценивать такие системы ещё нет.
Команда планирует опубликовать веса и данные обучения после завершения «процесса открытия исходного кода». Репозиторий с кодом уже появился на GitHub; на странице проекта размещены демки.
Компании разделяют задачи между моделями
Gander появилась после июльского выпуска Tencent — открытой языковой модели Hy3, которая, как сообщалось, сократила отставание от конкурентов, особенно в задачах для ИИ-агентов. Hy3 уже работает в WorkBuddy, Yuanbao и WeChat.
Кроме того, Tencent ведёт переговоры о покупке крупнейшей доли в стартапе Manus, занимающемся ИИ-агентами. Это происходит после того, как Пекин заблокировал приобретение Manus компанией Meta. Tencent считает сделку подходящей для собственных планов, включая ИИ-агента, встроенного в WeChat.
Другие компании используют оркестраторы, которые распределяют задачи между разными моделями:
Обработка перебиваний и задержки остаются практическими проблемами. Анализ Anthropic показал, что опытные пользователи перебивают Claude Code примерно в 9% рабочих шагов, а новички — примерно в 5%. Команды, создающие голосовых и текстовых ИИ-агентов для общения, особенно часто сообщают о проблемах с задержкой, говорится в обзоре.
Источник: the-decoder.com
Читайте также
Британский стартап привлёк $20 млн, чтобы воссоздавать концерты с «гиперреалистичными» цифровыми аватарами
Федеральный реестр США уличили в использовании китайской ИИ-модели для поиска документов
Крупнейший просчёт Трампа? Как один советник направил грандиозную панику вокруг ИИ
Цифровые ученики с реалистичными ошибками помогают ИИ-репетиторам учиться быстрее
Белый дом прикрывает ИИ-бум, семья Трампа и союзники богатеют — почти без ограничений
Runway хочет превратить генерацию видео с ИИ в управляемую трансляцию в реальном времени
Призывы замедлить развитие ИИ оправданны, но крах пузыря может стать более близкой угрозой
Muse от Meta лучше следит за мной, чем помогает
Вслед за OpenAI Anthropic, по сообщениям, тоже переносит IPO
Ежедневное использование ИИ в США за полгода выросло более чем вдвое
Почему Китай не соглашается с предупреждениями США о стремительном развитии ИИ
Всё больше австралийцев доживут до 90 с лишним лет — продолжительность жизни вырастет
Корпоративный код и процессы — на естественном языке? G5 Labs считает: G5 всё сделает
Какая ИИ-модель лучше для дизайна, видео и липсинка? OpenArt Arena ранжирует модели по задачам
Salesforce: ИИ-агент выполняет 93% браузерных задач вместо 43,5% без изменений модели
Anthropic сворачивает Claude Cowork в чат Claude и запускает Claude Docs и Claude Slides
Microsoft выпустила новый ИИ-плейбук для бизнеса: неожиданный «ров» уже может быть у вас
Трамп создаст «ИИ-силы» для контроля ИИ на фоне страха перед неуправляемыми агентами
Anthropic запустила Claude Code Projects — «всегда на связи» помнит и распределяет долгую разработку
Австралия почти не подготовилась к угрозам ИИ. Где блестящее руководство, когда нужно?
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram