Оглавление

Исследовательская группа Tencent Hunyuan Speech совместно с рядом университетов анонсировала Gander — мультимодальную модель, способную поддерживать диалог в реальном времени, одновременно выполняя ресурсоемкие фоновые задачи. Как сообщает пишет The Decoder, система обрабатывает речь, изображения и текст параллельно, что позволяет пользователю прерывать ИИ в любой момент, как это происходит в обычном человеческом общении.

Современные голосовые помощники чаще всего работают по принципу очередности: они слушают, замолкают, обрабатывают запрос и только потом отвечают. Gander пытается разрушить эту схему, используя архитектуру, вдохновленную человеческой анатомией, где функции разделены между условным «мозжечком» и «мозгом». Это позволяет системе сохранять высокую скорость реакции в чате, не жертвуя качеством планирования сложных операций.

Разделение труда: «мозжечок» против «мозга»

В основе Gander лежит элегантное инженерное решение: «мозжечок» отвечает за мгновенную коммуникацию и отслеживание контекста в секундных интервалах, в то время как сменный «мозг» занимается глубоким анализом и выполнением агентских задач, таких как написание кода или поиск в документах. Такая модульность позволяет обновлять основной вычислительный блок, например, подключая актуальные модели вроде GPT-5.6 Sol или специализированные инструменты вроде Claude Code, без необходимости переучивать разговорный интерфейс.

Система разбивает входящий поток данных на сегменты длительностью в одну секунду. Это дает Gander возможность почти мгновенно решать, стоит ли продолжать говорить, нужно ли прислушаться к перебившему его человеку или пора задать уточняющий вопрос. Память модели охватывает примерно две последние минуты разговора, чего вполне достаточно для удержания нити дискуссии без перегрузки вычислительных мощностей.

Разделение когнитивной нагрузки на быстрый интерфейсный слой и глубокий бэкэнд — здравый ход, решающий проблему латентности в голосовых интерфейсах. Однако архитектурное изящество разбивается о суровую реальность: пока Gander учится быть вежливым собеседником, он теряет в точности восприятия визуальных данных и уступает конкурентам в сложных логических тестах. Это классический компромисс между формой и содержанием, где социальные навыки временно перевесили профессиональные компетенции. Очередной «умный» ассистент, который отлично слушает, но не всегда понимает, что именно он увидел на экране.

Производительность и планы на открытый доступ

В ходе тестов на бенчмарке Full-Duplex-Bench v3 Gander продемонстрировал впечатляющие показатели тайминга: модель перебивала пользователя лишь в 8% случаев. Для сравнения, у GPT-Realtime этот показатель составил 13,5%, а некоторые конкуренты ошибались почти в половине сценариев. Тем не менее, общая точность выполнения задач у разработки Tencent оказалась несколько ниже, чем у коммерческих гигантов вроде Gemini Live или Grok.

Исследователи связывают этот разрыв с тем, что обучение было сфокусировано на плавности диалога, а не на точности распознавания объектов. Модель обучалась на датасете из 2,7 миллиона примеров, которые включали сценарии игнорирования фонового шума и корректного поведения в групповых чатах. Tencent планирует опубликовать веса модели и тренировочные данные после завершения внутренних процедур, а исходный код проекта уже доступен в репозитории на GitHub.

Этот шаг укладывается в общую стратегию компании по внедрению ИИ-агентов в свои ключевые продукты, такие как WeChat. На фоне активности других игроков, например Sakana AI с их проектом Fugu, становится очевидно, что индустрия уходит от монолитных моделей к оркестрации специализированных систем. Вопрос лишь в том, удастся ли Gander догнать лидеров в точности восприятия, прежде чем те окончательно освоят искусство не перебивать собеседника.