Вышла Qwen-Audio-3.1-Realtime — модель для голосового взаимодействия с агентами. В статье 2609.25176 она описана как система, которая одновременно рассуждает над меняющимися запросами, выполняет действия и соблюдает правила разговора. По сравнению с Qwen-Audio-3.0-Realtime общий успех задач вырос с 78.4% до 82.0% на полудуплексной адаптациирежиме работы, в котором ассистент и пользователь говорят по очереди, а не одновременно τ-VoiceПолудуплексная адаптация речи в текст, на которой Qwen-Audio-3.1-Realtime повышает общий успех задач с 78.4% до 82.0% по сравнению с Qwen-Audio-3.0-Realtime., а доля ответов на фоновую речь на Full-Duplex-Bench v1.5 упала с 73.0% до 13.0%.
Что именно изменилось
Модель собрана из трёх составляющих: Thinkкомпонент, который переносит языковые способности и развивает нативные аудионавыки, Actкомпонент, который учит модель пользоваться инструментами, интерпретировать обратную связь и доводить задачи до конца и Speak and Coordinateкомпонент, который решает, говорит ассистент или действует, и в какой момент.
Think отвечает за перенос языковых способностей и развитие нативных аудионавыков. Он сочетает дообучение с учителем с Multimodality and Multi-Teacher On-Policy Distillation (M²-OPD) — дистилляцией от нескольких учителей на собственных траекториях модели.
Act учит модель пользоваться инструментами, интерпретировать обратную связь и доводить задачи до конца. Для этого применяется обучение с подкреплением.
Speak and Coordinate решает, говорит ассистент или действует, и в какой момент. Именно этот компонент отвечает за координацию речи и действий в диалоге.
Оценка охватывает аудио-рассуждение, многоязычное понимание, использование инструментов, поведение в разговоре, полнодуплексное взаимодействиережим, в котором ассистент слушает и говорит одновременно и безопасность.
По сравнению с Qwen-Audio-3.0-Realtime версия 3.1 повышает общий успех задач с 78.4% до 82.0%.
Предыстория
Раздел News and Updates в репозитории фиксирует два релиза 2023 года. 15 ноября 2023 года вышла статья с деталями обучения и производительности, а 30 ноября 2023 года — контрольные точки Qwen-Audio и Qwen-Audio-Chat.
Qwen-Audio — предобученная многофункциональная модель понимания аудио: LLM инициализируется на Qwen-7B, аудиоэнкодер — на Whisper-large-v2. Модель принимает человеческую речь, естественные звуки, музыку и песни вместе с текстом, а на выходе даёт текст. Qwen-Audio-Chat — мультимодальный ассистент на базе LLM, обученный методами выравнивания; он поддерживает несколько аудиовходов, многораундовые вопросы-ответы и творческие возможности.
Почему это сделали
Формулировка задачи в статье: голосовые ассистенты реального времени должны рассуждать над меняющимися запросами, выполнять действия и следовать правилам разговора. Эти требования и объединяются через Think, Act и Speak and Coordinate.
Измеримая проблема, на которую указывают результаты, — избыточная реакция на фоновую речь: снижение с 73.0% до 13.0% на Full-Duplex-Bench v1.5. Второй показатель — успешность задач на полудуплексной адаптации τ-Voice, рост с 78.4% до 82.0%.
Что это меняет на практике
Для разработчиков, работавших с Qwen-Audio-Chat, доступны два пути запуска: через ModelScope или через Transformers. В варианте с Transformers модель загружается с доверием к удалённому коду, а запрос для чата собирается из аудио и текста: tokenizer.from_list_formatвызов, который принимает список фрагментов — например, аудиофайл и текст вопроса — и превращает их в единый формат запроса, понятный модели. В варианте с ModelScope чекпойнт сначала скачивается в локальную директорию, после чего токенизатор и модель загружаются оттуда же. Демо запускается командой python web_demo_audio.py.
При загрузке можно выбрать точность и устройство: bf16, fp16, cpu или cuda/auto. Гиперпараметры генерации задаются через GenerationConfig.from_pretrained, но это не требуется при transformers>4.32.0. В примерах вызовы генерации и чата не передают temperature или другие параметры сэмплирования; для воспроизводимости задаётся seed.
Для эксплуатации важно: модели Qwen-Audio лучше всего работают с аудиоклипами короче 30 секунд. Если при скачивании чекпойнтов и кода с Hugging Face возникает сетевая проблема, чекпойнт можно сначала получить с ModelScope и загрузить из локального каталога — доверие к удалённому коду при этом остаётся включённым, так как код читается из локальной директории, а не из transformers. ModelScope описывается как открытая платформа Model-as-a-Service (MaaS).
Ограничения и открытые вопросы
Авторы перечисляют направления оценки — аудио-рассуждение, многоязычное понимание, использование инструментов, поведение в разговоре, полнодуплексное взаимодействие и безопасность, — но не формулируют ограничения по языкам, доменам, безопасности, injection-атакам или масштабированию. Явных признаний открытых вопросов в тексте нет.
Не описаны и конкретные механизмы надёжности: прерывания, обработка перебиваний, восстановление после сбоев. Известно только, что Speak and Coordinate согласует, говорит ли ассистент или действует, и когда именно. Отдельно упоминается прототип Voice Harnessобвязка вокруг голосовой модели, расширяющая её до постоянных задач на базе Qwen-Audio-3.0-Realtime, который расширяет голосовое взаимодействие до постоянных задач через координацию foreground–backgroundразделение задач на активные, идущие на переднем плане, и фоновые и память.
Кроме двух названных метрик, других количественных результатов (ASR, задержки, доли успешных сессий, иные бенчмарки) для Qwen-Audio-3.1-Realtime не приводится.