Xiaomi MiMo выпустила MiMo-V2.6-Pro — модель с полным обозначением 1T-A42Bобозначение разреженной модели: триллион параметров всего, 42 миллиарда активных на каждый проход. Это флагман серии MiMo-V2.6, в которую входят две нативно омнимодальные модели: Pro как самая способная и Flash как баланс между интеллектом, эффективностью и стоимостью. Pro — триллионнопараметрическая модель с 42 млрд активных параметров, контекстным окном в один миллион токенов и поддержкой текста, изображений, аудио и видео.
Релиз интересен не только весами: компания открывает RL-окружения, фреймворк пост-тренировки и агентные обвязки, а стоимость RL-прогона раскрывает через публичный дашборд — $2,620,670 для Pro и $854,044 для Flash, около $3.5 млн в сумме.
Что означает 1T-A42B
Суффикс в названии описывает архитектуру: всего у модели триллион параметров, но на каждый forward passодин проход вывода — вычисление, при котором модель порождает следующий токен исполняется только 42 млрд. Это MoEMixture of Experts — архитектура, где маршрутизатор выбирает подмножество экспертов на каждый токен, поэтому активных параметров меньше, чем всего. Активные параметры — те, что реально исполняются за один проход вывода, в миллиардах.
Меньшее число активных параметров напрямую влияет на цену инференса. Xiaomi указывает $0.43 за 1M входных токенов и $0.87 за 1M выходных; при смешанном соотношении 7:2:1 (кэш-попадание/вход/выход) — $0.18 за 1M токенов. Кэш-попадание — это обращение к уже обработанному фрагменту промпта, который хранится в кэше и оплачивается со скидкой по сравнению с обычным входом; соотношение 7:2:1 задаёт доли таких обращений, новых входных и выходных токенов в смешанном тарифе. Одна задача Intelligence Indexсводный показатель интеллекта модели от Artificial Analysis, объединяющий 10 оценок обходится в $0.13, что выводит модель на границу Парето по соотношению интеллекта и стоимости за задачу.
Окно контекста — 1.0M токенов, в спецификациях это примерно 1500 страниц A4 шрифтом Arial 12. Обучение велось с контекстом до 1M длины, а RL-прогон был нацелен на более длинные агентные задачи.
Что именно открыто
Веса выпущены под лицензией MIT вместе с техническим отчётом. MIT не несёт условий, которые накладывают, например, Moonshot Kimi K3 и Alibaba Qwen3.8-Max для крупных коммерческих пользователей.
Помимо весов Xiaomi заявляет о «полностью открытых» RL-ресурсах: более 7000 сред для задач (software engineering, воспроизведение уязвимостей, knowledge work, web development), сквозной фреймворк обучения от взаимодействия со средой до оценки награды и оптимизации политики, а также лёгкие агентные обвязки для экспериментов с инструментами, промптами и контекстом.
Обычный open-weight релизвыпуск, при котором публикуются в основном скачиваемые веса — набор числовых значений, выученных моделью при обучении, — тогда как большая часть процесса их создания остаётся закрытой — это в первую очередь веса. Отличие в том, что при релизе сред у внешних исследователей появляется гораздо больше пост-тренировочного процесса для изучения и развития.
Оговорка: на момент публикации ссылка Xiaomi на открытую коллекцию на Hugging Face содержала только три релиза моделей, а 7000+ сред и прочие вспомогательные ресурсы там не были представлены. Ранее Luo говорила, что Xiaomi откроет различные элементы «в ближайшие недели».
Предыстория: MiMo-7B и полгода тишины
Предыдущая серия MiMo-7B включала base-модель, предобученную примерно на 25 триллионах токенов, SFT-модельмодель, дообученную на примерах правильных ответов (supervised fine-tuning), обученную от base, RL-модельмодель, дообученную методом проб и наград (reinforcement learning) от base (MiMo-7B-RL-Zero) и RL-модель от SFT (MiMo-7B-RL) с производительностью на уровне OpenAI o1-mini.
Почти полгода тишины перед новым релизом команда потратила на один вопрос — насколько далеко может масштабироваться RL. Об этом написала Fuli Luo, руководитель команды MiMo. Масштабировались три вещи: вычисления (примерно 2 млрд токенов на шаг, 1568 промптов × 16 прогонов, полностью асинхронно), среды и обвязки, а также ресурсы для оценки попыток модели. Xiaomi транслировала RL-прогоны через публичный дашборд, показывая метрики производственных запусков в реальном времени в течение пяти дней начиная с 15 сентября.
Обучение MiMo-V2.6 масштабировало RL по трём осям: большие батчи и высокая пропускная способность (1568 сэмплов на обновление, 3.5–3.7 млрд токенов на шаг), больше задач и сред (multi-task-набор по кодингу, general-агентам, визуальным и кибер-задачам, смешанный через несколько обвязок), больше вычислений на оценку (относительное сравнение внутри группы даёт длинным RL-задачам более точные и разнообразные сигналы награды).
Почему акцент на RL-окружениях
Причина в том, что при RLVRRL с проверяемыми наградами — обучение с подкреплением на задачах, результат которых можно проверить автоматически, например пройден ли тест кодом именно окружения становятся ключевым ингредиентом обучения: RLVR зависит от задач с автоматически проверяемым результатом. Томас Вульф сформулировал это так: выпуск качественных открытых RL-окружений — самое значимое, что можно сделать для продвижения открытой границы, эквивалент обмена качественными данными предобучения в новой парадигме RLVR. Он же назвал уровень открытости впечатляющим для столь крупного прогона.
Эли Бакуш выделил обещание выпустить ~7 тыс. RL-данных и фреймворк, а также скорость: модель и техотчёт вышли менее чем через неделю после старта финального RL-прогона. Отдельно он отметил статью Xiaomi об environment/data-factory для генерации RL-задач из открытых репозиториев с агентами в цикле для устойчивости и защиты от читерства.
Как запускать
Для локального развёртывания в SGLang нужно установить последнюю версию из ветки main и запустить сервер с флагом --trust-remote-code. Для режима MTPмноготокенное предсказание: модель за один проход предлагает сразу несколько следующих токенов, а не один добавляются флаги спекулятивного декодирования EAGLEметод спекулятивного декодирования, при котором черновые токены предлагает лёгкая голова модели, а основные веса их проверяют. Для vLLM официально рекомендуется форк, поддерживающий MiMo-MTP.
Чтобы запускать модель без MTP-параметров, файл регистрации копируют в свой каталог и импортируют — он регистрирует класс модели в реестре vLLM. При загрузке весов параметры с mtp_layers в имени пропускаются, как и rotary_emb.inv_freq.
Отдельная ветка загрузчика обрабатывает масштабы квантования KV-кэша: если у модели есть конфигурация квантования и её метод возвращает имя для текущего веса, берётся соответствующий параметр и его загрузчик, тензор при необходимости приводится к скаляру. Эта ветка срабатывает до сопоставления стекированных параметровПараметры, которые в загрузчике весов переименовываются и объединяются: q_proj/k_proj/v_proj в qkv_proj, а gate_proj/up_proj в gate_up_proj., поэтому такие веса не проходят обычное переименование.
В примере запуска строка num_speculative_tokens=1 закомментирована.
Позиция и цифры
Artificial Analysis даёт MiMo-V2.6-Pro оценку 46 по Intelligence Index и ставит его первым среди 117 моделей своего класса; среди 114 крупных открытых моделей, которые отслеживает сервис, он тоже первый. Xiaomi при этом традиционно не считается одной из шести китайских AI Tigers.
Intelligence Index — сводный показатель из 10 оценок: AA-Briefcase v1.1оценка работы с деловыми документами и задачами, GDPval-AA v2.1оценка на задачах, приближенных к реальной профессиональной работе, AutomationBench-AAоценка автоматизации действий и рабочих процессов, Terminal-Bench 4.0оценка работы в терминале и командной строке, SciCodeоценка решения научных задач программирования, Humanity's Last Examнабор сложных вопросов на широкие знания, GDP.pdfоценка работы с PDF-документами, CritPtоценка по физике, AA-Omniscienceоценка широты знаний, AA-LCR v1.1оценка на длинном контексте. Цена за задачу считается как взвешенная средняя: стоимость каждой оценки складывается из цен input, cache hit, cache write, reasoning и answer токенов, делится на число задач и взвешивается по весу в индексе. Cache Hit — цена за токен для кэшированных промптов, обычно со значительной скидкой. Output Speed измеряется в токенах в секунду после первого чанка при потоковой генерации, задержка — как время до первого токена ответа, включая время «размышления» для reasoning-моделей.
Оценка стоимости обучения в $3 млн покрывает только этап RL; стоимость предобучения Xiaomi не раскрывала. Упоминаемое ускорение токенизации до 30x относится к библиотеке Hugging Face tokenizers v1 RC, а не к самой модели. Вариант MiMo-V2.6-Pro-UltraSpeed обеспечивает до 20x более быстрый вывод при том же качестве.
Ограничения и открытые вопросы
Нерешённым остаётся лицензирование. Обсуждается, применяется ли формулировка «commercial use not allowed» только к обслуживанию, распространению или монетизации самой модели и материалов, либо также ограничивает выходные данные, сгенерированные моделью. Пока канонический файл лицензии не обновлён, пользователи, сравнивающие его с разрешительными лицензиями в стиле Apache-2.0/MIT, могут обоснованно избегать коммерческих сценариев несмотря на разъяснение. Для MiMo-V2.6-Pro при этом указано, что он выпущен под MIT и эта лицензия разрешает коммерческое использование.
Отдельно поднимается размывание терминов: «open-weight» и «open-source» routinely используются как синонимы, хотя не являются таковыми, а многие «открытые» модели сводятся к скачиваемым весам. В качестве примера приводится Meta, которая часто называла свои модели Llama открытыми несмотря на значительные ограничения.
Бенчмарк CritPt помечен как «Under review», данные о скорости инференса и стоимости задачи указаны как «Not publicly available».