Microsoft представила Microsoft-Decision-1 — модель, которая не генерирует текст, а оценивает заранее заданные варианты ответа или действия. Получив вопрос и набор вариантов, она присваивает каждому вероятностную оценку. Что делать с этой оценкой, решает приложение: разрешить агенту выполнить шаг, потребовать повторной попытки или передать задачу человеку.
Модель опубликована под именем Microsoft-Decision-1 и доступна в Microsoft Foundry и через OpenRouter. Входные токены стоят $0,042 за миллион, выходные не тарифицируются.
Что именно изменилось
Обычная LLMбольшая языковая модель, предназначенная для генерации текста или рассуждений выдаёт текст, который ещё нужно разобрать и превратить в решение. Decision-1 устроена иначе: на вход подаётся фиксированный набор вариантов, на выходе — калиброванная вероятностьоценка уверенности, при которой заявленная вероятность совпадает с частотой правильных ответов для каждого варианта. Калибровка нужна приложению, чтобы по числу от модели можно было принимать решение: если модель говорит «70%», это значит, что в 70 случаях из 100 такой ответ оказывается верным, — и порог, при котором агенту разрешают шаг, повторяют попытку или передают задачу человеку, можно задавать прямо по этой оценке. Поддерживаются «да/нет», множественный выбор, рейтинговые шкалы и оценка по рубрикам — ответов ИИ и действий агента. Всё это через один структурированный вызов API, возвращающий JSON.
Модель построена на базе Qwen3.5-9B: Microsoft дообучила её для быстрого одношагового decision scoringоценивания готовых вариантов ответа или действия, когда модель за один проход присваивает каждому варианту вероятность. В дальнейшем компания планирует перенести её на другие базовые модели, включая Microsoft AI (MAI) и OpenAI.
Заявленные замеры: медианная задержка в 35 раз меньше, чем у GPT-6 Sol, и в 2,5 раза меньше, чем у занявшей второе место H2O-Lightning-4B v1.1. По точности — наибольшая среди сравниваемых моделей по совокупности 36 бенчмарков, охватывающих почти 150 000 вопросов.
Предыстория
Раньше выбор модели или варианта решали тремя способами. При ручной маршрутизацииразработчик сам заранее определяет, какая модель используется для класса задач решение принимали на основе экспертной оценки или тестирования. При автоматической маршрутизациисистема анализирует свойства запроса и выбирает модель перед выполнением задачи выбор чаще всего строится на фиксированных правилах, а в более сложной схеме используется отдельный маршрутизаторкомпонент, который определяет, какая модель лучше подходит конкретному запросу на LLM или классических моделях классификации.
The New Stack описывает мотивацию Microsoft так: у компании есть стимул обрабатывать решения по маршрутизации внутри, поскольку такие решения нужны в Copilot, GitHub и Xbox. При низких ценах на отдельные decision-вызовыобращения к модели для получения решения основной возможностью названо удержание агентского трафика, включая генеративные вызовы вокруг каждого решения, внутри Foundry. Прямой причины, по которой Microsoft пропустила decision-модельмодель, которая оценивает заданные варианты и выдаёт решение, а не генерирует текст OpenAI, источники не называют — упоминается только сам факт.
Почему это сделали
Авторы формулируют проблему так: LLM предназначены для генерации текста или рассуждений, а не для выдачи структурированных выходов, которые ПО может сразу использовать. Decision-модели, по их описанию, созданы именно для этого.
Второй аргумент — задержка. Каждое решение добавляет время, особенно когда один шаг зависит от другого: добавление 100 миллисекунд к каждому из 20 последовательных решений добавляет две секунды к общему рабочему процессу.
Отсюда упор на скорость: P50-задержкамедианная задержка, то есть время ответа, которое не превышается в половине запросов Microsoft-Decision-1 примерно в 35 раз меньше, чем у GPT-6 Sol.
Что это меняет на практике
Модель встраивается в пайплайны как шаг выбора действия. Для маршрутизации она оценивает входящий запрос и выбирает лучшую модель по качеству, стоимости и задержке. В агентных системах применяет правила навыка агента для выбора следующего действия без повторной обработки длинного списка инструкций.
Схема тарификации — $0,042 за миллион входных токенов, выходные бесплатны — выгодна приложениям, которые часто классифицируют запросы или выбирают дальнейшие действия. В сценарии Xbox Research модель распределила более 10 000 отзывов игроков по темам: качество классификации сопоставимо с GPT-6 Sol, но более чем в 14 раз быстрее при затратах примерно в 200 раз ниже. В тестах команды Microsoft Copilot на оценку качества ответов результат сопоставим с GPT-5.6 Luna при стократном преимуществе в скорости. Экономию при этом стоит считать по стоимости готового проверенного изменения, включая повторные попытки, а не только по тарифу за токен.
Ограничения и открытые вопросы
Модель работает только с текстом: принимает до 32 768 токенов и возвращает JSON, изображения не поддерживаются. Microsoft ещё не объявила об открытых весах.
Устойчивость проверяли: тесты с восемью видами возмущений, включая перестановку вариантов и перефразирование описаний, изменили в среднем 1,3% ответов.
Отдельно стоит эластичная маршрутизация экспертовметод, при котором число активных экспертов на каждом шаге стохастически сэмплируется из локализованного дискретного распределения с центром в k, что за несколько итераций обучения смягчает жёсткую границу top-k в постепенное распределение вероятностей. Идея предложена в статье arXiv 2610.11575 «Smoothing the Top-k Exposure Boundary for Sparse Mixture-of-Experts». Связи между Decision-1 и этим методом нет: Decision-1 применяется для маршрутизации запросов, принятия решений по навыкам, разметки данных и AI-суддействаавтоматической оценки качества ответов ИИ по заданным критериям.