Назад к блогу

MiMo-V2.6-Pro: триллион параметров, 42 млрд активных и открытый RL-стек

MiMo-V2.6-Pro: триллион параметров, 42 млрд активных и открытый RL-стек

Xiaomi представила MiMo-V2.6-Pro — триллионнопараметрическую MoE-модель с 42 млрд активных параметров и контекстом в 1 млн токенов, причём под либеральной лицензией MIT. Главная интрига не в весах, а в открытии всего RL-стека: тысяч сред, фреймворка пост-тренировки и агентных обвязок, а также в публичном раскрытии реальной стоимости RL-прогонов — около $3,5 млн за обучение обеих моделей серии.

Xiaomi MiMo выпустила MiMo-V2.6-Pro — модель с полным обозначением 1T-A42B. Это флагман серии MiMo-V2.6, в которую входят две нативно омнимодальные модели: Pro как самая способная и Flash как баланс между интеллектом, эффективностью и стоимостью. Pro — триллионнопараметрическая модель с 42 млрд активных параметров, контекстным окном в один миллион токенов и поддержкой текста, изображений, аудио и видео.

Релиз интересен не только весами: компания открывает RL-окружения, фреймворк пост-тренировки и агентные обвязки, а стоимость RL-прогона раскрывает через публичный дашборд — $2,620,670 для Pro и $854,044 для Flash, около $3.5 млн в сумме.

Что означает 1T-A42B

Суффикс в названии описывает архитектуру: всего у модели триллион параметров, но на каждый forward pass исполняется только 42 млрд. Это MoE. Активные параметры — те, что реально исполняются за один проход вывода, в миллиардах.

Меньшее число активных параметров напрямую влияет на цену инференса. Xiaomi указывает $0.43 за 1M входных токенов и $0.87 за 1M выходных; при смешанном соотношении 7:2:1 (кэш-попадание/вход/выход) — $0.18 за 1M токенов. Кэш-попадание — это обращение к уже обработанному фрагменту промпта, который хранится в кэше и оплачивается со скидкой по сравнению с обычным входом; соотношение 7:2:1 задаёт доли таких обращений, новых входных и выходных токенов в смешанном тарифе. Одна задача Intelligence Index обходится в $0.13, что выводит модель на границу Парето по соотношению интеллекта и стоимости за задачу.

Окно контекста — 1.0M токенов, в спецификациях это примерно 1500 страниц A4 шрифтом Arial 12. Обучение велось с контекстом до 1M длины, а RL-прогон был нацелен на более длинные агентные задачи.

Что именно открыто

Веса выпущены под лицензией MIT вместе с техническим отчётом. MIT не несёт условий, которые накладывают, например, Moonshot Kimi K3 и Alibaba Qwen3.8-Max для крупных коммерческих пользователей.

Помимо весов Xiaomi заявляет о «полностью открытых» RL-ресурсах: более 7000 сред для задач (software engineering, воспроизведение уязвимостей, knowledge work, web development), сквозной фреймворк обучения от взаимодействия со средой до оценки награды и оптимизации политики, а также лёгкие агентные обвязки для экспериментов с инструментами, промптами и контекстом.

Обычный open-weight релиз — это в первую очередь веса. Отличие в том, что при релизе сред у внешних исследователей появляется гораздо больше пост-тренировочного процесса для изучения и развития.

Оговорка: на момент публикации ссылка Xiaomi на открытую коллекцию на Hugging Face содержала только три релиза моделей, а 7000+ сред и прочие вспомогательные ресурсы там не были представлены. Ранее Luo говорила, что Xiaomi откроет различные элементы «в ближайшие недели».

Предыстория: MiMo-7B и полгода тишины

Предыдущая серия MiMo-7B включала base-модель, предобученную примерно на 25 триллионах токенов, SFT-модель, обученную от base, RL-модель от base (MiMo-7B-RL-Zero) и RL-модель от SFT (MiMo-7B-RL) с производительностью на уровне OpenAI o1-mini.

Почти полгода тишины перед новым релизом команда потратила на один вопрос — насколько далеко может масштабироваться RL. Об этом написала Fuli Luo, руководитель команды MiMo. Масштабировались три вещи: вычисления (примерно 2 млрд токенов на шаг, 1568 промптов × 16 прогонов, полностью асинхронно), среды и обвязки, а также ресурсы для оценки попыток модели. Xiaomi транслировала RL-прогоны через публичный дашборд, показывая метрики производственных запусков в реальном времени в течение пяти дней начиная с 15 сентября.

Обучение MiMo-V2.6 масштабировало RL по трём осям: большие батчи и высокая пропускная способность (1568 сэмплов на обновление, 3.5–3.7 млрд токенов на шаг), больше задач и сред (multi-task-набор по кодингу, general-агентам, визуальным и кибер-задачам, смешанный через несколько обвязок), больше вычислений на оценку (относительное сравнение внутри группы даёт длинным RL-задачам более точные и разнообразные сигналы награды).

Почему акцент на RL-окружениях

Причина в том, что при RLVR именно окружения становятся ключевым ингредиентом обучения: RLVR зависит от задач с автоматически проверяемым результатом. Томас Вульф сформулировал это так: выпуск качественных открытых RL-окружений — самое значимое, что можно сделать для продвижения открытой границы, эквивалент обмена качественными данными предобучения в новой парадигме RLVR. Он же назвал уровень открытости впечатляющим для столь крупного прогона.

Эли Бакуш выделил обещание выпустить ~7 тыс. RL-данных и фреймворк, а также скорость: модель и техотчёт вышли менее чем через неделю после старта финального RL-прогона. Отдельно он отметил статью Xiaomi об environment/data-factory для генерации RL-задач из открытых репозиториев с агентами в цикле для устойчивости и защиты от читерства.

Как запускать

Для локального развёртывания в SGLang нужно установить последнюю версию из ветки main и запустить сервер с флагом --trust-remote-code. Для режима MTP добавляются флаги спекулятивного декодирования EAGLE. Для vLLM официально рекомендуется форк, поддерживающий MiMo-MTP.

Чтобы запускать модель без MTP-параметров, файл регистрации копируют в свой каталог и импортируют — он регистрирует класс модели в реестре vLLM. При загрузке весов параметры с mtp_layers в имени пропускаются, как и rotary_emb.inv_freq.

Отдельная ветка загрузчика обрабатывает масштабы квантования KV-кэша: если у модели есть конфигурация квантования и её метод возвращает имя для текущего веса, берётся соответствующий параметр и его загрузчик, тензор при необходимости приводится к скаляру. Эта ветка срабатывает до сопоставления стекированных параметров, поэтому такие веса не проходят обычное переименование.

В примере запуска строка num_speculative_tokens=1 закомментирована.

Позиция и цифры

Artificial Analysis даёт MiMo-V2.6-Pro оценку 46 по Intelligence Index и ставит его первым среди 117 моделей своего класса; среди 114 крупных открытых моделей, которые отслеживает сервис, он тоже первый. Xiaomi при этом традиционно не считается одной из шести китайских AI Tigers.

Intelligence Index — сводный показатель из 10 оценок: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1. Цена за задачу считается как взвешенная средняя: стоимость каждой оценки складывается из цен input, cache hit, cache write, reasoning и answer токенов, делится на число задач и взвешивается по весу в индексе. Cache Hit — цена за токен для кэшированных промптов, обычно со значительной скидкой. Output Speed измеряется в токенах в секунду после первого чанка при потоковой генерации, задержка — как время до первого токена ответа, включая время «размышления» для reasoning-моделей.

Оценка стоимости обучения в $3 млн покрывает только этап RL; стоимость предобучения Xiaomi не раскрывала. Упоминаемое ускорение токенизации до 30x относится к библиотеке Hugging Face tokenizers v1 RC, а не к самой модели. Вариант MiMo-V2.6-Pro-UltraSpeed обеспечивает до 20x более быстрый вывод при том же качестве.

Ограничения и открытые вопросы

Нерешённым остаётся лицензирование. Обсуждается, применяется ли формулировка «commercial use not allowed» только к обслуживанию, распространению или монетизации самой модели и материалов, либо также ограничивает выходные данные, сгенерированные моделью. Пока канонический файл лицензии не обновлён, пользователи, сравнивающие его с разрешительными лицензиями в стиле Apache-2.0/MIT, могут обоснованно избегать коммерческих сценариев несмотря на разъяснение. Для MiMo-V2.6-Pro при этом указано, что он выпущен под MIT и эта лицензия разрешает коммерческое использование.

Отдельно поднимается размывание терминов: «open-weight» и «open-source» routinely используются как синонимы, хотя не являются таковыми, а многие «открытые» модели сводятся к скачиваемым весам. В качестве примера приводится Meta, которая часто называла свои модели Llama открытыми несмотря на значительные ограничения.

Бенчмарк CritPt помечен как «Under review», данные о скорости инференса и стоимости задачи указаны как «Not publicly available».

Источники

Похожее