Назад к блогу

Qwen-Audio-3.1-Realtime: три составляющие агентного голосового ассистента

Qwen-Audio-3.1-Realtime: три составляющие агентного голосового ассистента

Вышла Qwen-Audio-3.1-Realtime — голосовая модель, которая объединяет рассуждение, вызов инструментов и управление диалогом в единую систему. Заметнее всего улучшение в поведении при фоновом шуме: доля лишних реакций на постороннюю речь упала с 73% до 13%. Разбор трёх компонентов архитектуры и того, как это меняет разработку голосовых ассистентов, — в статье.

Вышла Qwen-Audio-3.1-Realtime — модель для голосового взаимодействия с агентами. В статье 2609.25176 она описана как система, которая одновременно рассуждает над меняющимися запросами, выполняет действия и соблюдает правила разговора. По сравнению с Qwen-Audio-3.0-Realtime общий успех задач вырос с 78.4% до 82.0% на полудуплексной адаптации τ-Voice, а доля ответов на фоновую речь на Full-Duplex-Bench v1.5 упала с 73.0% до 13.0%.

Что именно изменилось

Модель собрана из трёх составляющих: Think, Act и Speak and Coordinate.

Think отвечает за перенос языковых способностей и развитие нативных аудионавыков. Он сочетает дообучение с учителем с Multimodality and Multi-Teacher On-Policy Distillation (M²-OPD) — дистилляцией от нескольких учителей на собственных траекториях модели.

Act учит модель пользоваться инструментами, интерпретировать обратную связь и доводить задачи до конца. Для этого применяется обучение с подкреплением.

Speak and Coordinate решает, говорит ассистент или действует, и в какой момент. Именно этот компонент отвечает за координацию речи и действий в диалоге.

Оценка охватывает аудио-рассуждение, многоязычное понимание, использование инструментов, поведение в разговоре, полнодуплексное взаимодействие и безопасность.

По сравнению с Qwen-Audio-3.0-Realtime версия 3.1 повышает общий успех задач с 78.4% до 82.0%.

Предыстория

Раздел News and Updates в репозитории фиксирует два релиза 2023 года. 15 ноября 2023 года вышла статья с деталями обучения и производительности, а 30 ноября 2023 года — контрольные точки Qwen-Audio и Qwen-Audio-Chat.

Qwen-Audio — предобученная многофункциональная модель понимания аудио: LLM инициализируется на Qwen-7B, аудиоэнкодер — на Whisper-large-v2. Модель принимает человеческую речь, естественные звуки, музыку и песни вместе с текстом, а на выходе даёт текст. Qwen-Audio-Chat — мультимодальный ассистент на базе LLM, обученный методами выравнивания; он поддерживает несколько аудиовходов, многораундовые вопросы-ответы и творческие возможности.

Почему это сделали

Формулировка задачи в статье: голосовые ассистенты реального времени должны рассуждать над меняющимися запросами, выполнять действия и следовать правилам разговора. Эти требования и объединяются через Think, Act и Speak and Coordinate.

Измеримая проблема, на которую указывают результаты, — избыточная реакция на фоновую речь: снижение с 73.0% до 13.0% на Full-Duplex-Bench v1.5. Второй показатель — успешность задач на полудуплексной адаптации τ-Voice, рост с 78.4% до 82.0%.

Что это меняет на практике

Для разработчиков, работавших с Qwen-Audio-Chat, доступны два пути запуска: через ModelScope или через Transformers. В варианте с Transformers модель загружается с доверием к удалённому коду, а запрос для чата собирается из аудио и текста: tokenizer.from_list_format. В варианте с ModelScope чекпойнт сначала скачивается в локальную директорию, после чего токенизатор и модель загружаются оттуда же. Демо запускается командой python web_demo_audio.py.

При загрузке можно выбрать точность и устройство: bf16, fp16, cpu или cuda/auto. Гиперпараметры генерации задаются через GenerationConfig.from_pretrained, но это не требуется при transformers>4.32.0. В примерах вызовы генерации и чата не передают temperature или другие параметры сэмплирования; для воспроизводимости задаётся seed.

Для эксплуатации важно: модели Qwen-Audio лучше всего работают с аудиоклипами короче 30 секунд. Если при скачивании чекпойнтов и кода с Hugging Face возникает сетевая проблема, чекпойнт можно сначала получить с ModelScope и загрузить из локального каталога — доверие к удалённому коду при этом остаётся включённым, так как код читается из локальной директории, а не из transformers. ModelScope описывается как открытая платформа Model-as-a-Service (MaaS).

Ограничения и открытые вопросы

Авторы перечисляют направления оценки — аудио-рассуждение, многоязычное понимание, использование инструментов, поведение в разговоре, полнодуплексное взаимодействие и безопасность, — но не формулируют ограничения по языкам, доменам, безопасности, injection-атакам или масштабированию. Явных признаний открытых вопросов в тексте нет.

Не описаны и конкретные механизмы надёжности: прерывания, обработка перебиваний, восстановление после сбоев. Известно только, что Speak and Coordinate согласует, говорит ли ассистент или действует, и когда именно. Отдельно упоминается прототип Voice Harness на базе Qwen-Audio-3.0-Realtime, который расширяет голосовое взаимодействие до постоянных задач через координацию foreground–background и память.

Кроме двух названных метрик, других количественных результатов (ASR, задержки, доли успешных сессий, иные бенчмарки) для Qwen-Audio-3.1-Realtime не приводится.

Источники

Похожее