5 октября 2026 года компания Reflection представила Beam — свою первую передовую модель с открытыми весами. Это текстовая модель архитектуры «смесь экспертов» на 501 млрд общих параметров и 23 млрд активных, предобученная на 23,8 трлн токенов с контекстным окном в 1 млн токенов. Компания позиционирует её как «рабочую модель» для предприятий, государственного сектора и разработчиков и заявляет, что на сложных бенчмарках рассуждений Beam не уступает ведущим китайским открытым моделям, используя «в 3–4 раза меньше вычислительных ресурсов для инференса».
Что именно изменилось
Beam — разреженная MoEMixture-of-Experts: архитектура, в которой разные части сети специализируются на разных входах, а на каждый токен активируется лишь часть параметров. Из 501 млрд общих параметров активны 23 млрд. Модель обучалась на 23,8 трлн токенов и рассчитана на кодинг, рассуждения и агентные задачи.
Архитектура включает 52 слоя и чередование глобального и скользящего оконного внимания в пропорции 3:1. За счёт этого остаточный поток удерживается от роста и выбросов, поэтому его RMS остаётся ограниченным на всех 52 слоях.
Для балансировки нагрузки на экспертов обучение устроено так, что загрузка экспертов почти равномерна: самый нагруженный эксперт в среднем по MoE-слоям достигает лишь 1,04× к концу предобучения.
Веса планируется выпустить под лицензией Apache 2.0. Термин open-weightмодель с доступными весами, конкретные права на использование которой определяет лицензия описывает именно условия распространения, а не свободу использования: лицензии у таких моделей различаются — веса и репозиторий DeepSeek V4 распространяются под MIT, Muse Glimmer — под Apache 2.0, а Kimi K3 выходит под собственной лицензией.
В анонсе приведены результаты по нескольким группам бенчмарков. В группе Agentic Coding/Terminal: DeepSWE, SWE Bench Pro v2-Hard, SWE Bench Pro v1, Terminal Bench v2.1, SWE Atlas Codebase QnA, SWEBench Multilingual и SWEBench Verified. В группе Reasoning: AIME 2026, HLE no tools, SciCode, CriPT AA и GPQA Diamond. В группе Tool Calling/Search: AutomationBench public, MCP Atlas, tau3 banking, BrowseComp w/ context management и DeepSearchQA w/context management. В группе General Capabilities: AA-LCR, LongBench v2, IFBench и AA Omniscience (index) — public split only (our results). Обозначение NR в таблицах указывает на оценки, которые не были представлены.
Как обучали модель
Предобучение заняло менее четырёх недель на кластере из 6144 GPU NVIDIA GB300 NVL72. Goodputдоля времени, потраченного на шаги обучения, которые вошли в итоговую модель достиг 92,3% к концу благодаря улучшениям в чекпоинтинге, обнаружении сбоев и управлении здоровьем узлов. Оценка MFUдоля пиковой вычислительной мощности ускорителей, которую удалось использовать в BF16 при предобучении составила лишь около 12%.
Качество данных обеспечивалось через «quality-centric data curation»: пайплайн сохранял исходный код, технические объяснения и математико-научные знания на всех этапах обработки. Были обучены собственные классификаторы качества для веб-, кодового и STEM-контента, данные делились на мелкозернистые уровни качества, а обучение смещалось в сторону более сильного материала. Около 95% сырых интернет-токенов отбрасывалось через парсинг, дедупликацию и курирование, но при этом сохранялось примерно 1,8 трлн высококачественных токенов, которые обычные методы пропустили бы, включая 87% курированных веб-кодовых токенов. Для кода применялись индивидуально настроенные фильтры по каждому языку, удалялся низкокачественный автогенерированный и необучаемый контент, обучались классификаторы для выявления повреждённого контента или кода, вредящего стабильности обучения.
RL-этап шёл на пуле из почти одного миллиона окружений, созданных в основном синтетическими пайплайнами, дополненными данными от вендоров и открытыми источниками. Во время обучения поддерживалось в среднем 110K одновременных роллаутовпараллельных прогонов модели в окружении, на которых собирается опыт для обучения с подкреплением, число одновременных sandbox доходило до 170K. Запуск длился четыре недели на 10.5K GPU NVIDIA GB300, сгенерировав более 100 миллионов роллаутов при максимальной длине контекста 256K токенов; обучение и оценка использовали примерно 1.3 миллиарда sandbox. Задачи охватывали software engineering, terminal use, competitive coding, STEM, web search, tool use и general knowledge work.
На графике Figure 3 показаны оценки Terminal-Bench 2.1, HLE и DeepSWE как функция накопленного числа RL-роллаутов при обучении reasoning-эксперта, при этом учтены 80M из более чем 100M роллаутов за всю кампанию. Для сравнения: Inkling обучался на 30M роллаутов, а MiMo — на 753K. Отдельно Figure 5 показывает оценки DeepSWE в течение части RL-прогона, а граница Паретонабор наилучших сочетаний качества и затрат, где улучшение одного показателя возможно только за счёт другого движется в две фазы: сначала сжимается, так как политика учится быть более экономной по токенам, затем более высокие уровни reasoning effort расширяются наружу для достижения высокой производительности. Пользователи могут управлять этим компромиссом через параметр reasoning effort: меньшие значения дают более короткие ответы, а большие позволяют более длинные рассуждения для повышения производительности на сложных задачах.
Предыстория
Reflection основана в 2024 году двумя бывшими исследователями Google DeepMind. Компания привлекла примерно $4,7 млрд от инвесторов, включая Nvidia, Sequoia Capital и Lightspeed Venture Partners, по данным PitchBook. Последний раунд оценил компанию в $25 млрд pre-money.
Beam описывается как открытая модель, которая, по заявлению компании, не уступает ведущим китайским открытым моделям в тестах на сложные логические рассуждения, но обходится значительно дешевле, что может обострить конкуренцию в создании западного аналога китайских моделей DeepSeek, Qwen и Z.ai. Конкретно по производительности Beam сравнивается с моделью GLM-5.2 китайской Z.ai: у Beam 501 млрд параметров, из которых 23 млрд активных, тогда как у GLM-5.2 около 744 млрд параметров, из которых 40 млрд активные. Reflection позиционирует себя как конкурента закрытым лабораториям вроде Anthropic и OpenAI, популярным моделям китайских разработчиков, а также западным игрокам, включая Mistral, Meta и Cohere.
Почему это сделали
Выпуск Beam — заявка на западный ответ китайским открытым моделям. Компания утверждает, что модель не уступает ведущим китайским открытым моделям в тестах на сложные логические рассуждения, но обходится значительно дешевле. Проблема, которую это решает, — отсутствие американской open-weight альтернативы: поскольку модель обучена с нуля в США, существует сегмент рынка, который ждал здесь больше вариантов.
Конкурентное преимущество строится на эффективности инференса: Beam конкурентоспособен с более крупными открытыми моделями вроде GLM 5.2 и приближается к Qwen 3.8-Max в задачах кодинга и агентских задач, а его преимущество — эффективность на этапе инференса. При этом по сырым возможностям лидерство остаётся за китайскими моделями: там, где фронтирные открытые модели вроде Kimi K3 остаются впереди по сырым возможностям, выигрыш Beam — именно в эффективности инференса.
Заявление о меньших вычислительных затратах подкрепляется оценкой вычислительных затрат на генерацию:
FLOPs ≈ 2 × active parameter count × mean generated tokens per attemptКаждое умножение-сложение считается за две операции, а для mixture-of-experts берутся активируемые параметры, а не полный размер модели. Экономия ещё заметнее по сравнению с моделями семейства 2T+ параметров, например Qwen 3.8-Max, которые требуют значительно больше вычислений на токен. Сами авторы оговаривают, что оценки исключают prefillпредварительную обработку промпта, зависящие от контекста операции внимания и накладные расходы обслуживания, поэтому это приблизительное сравнение, а не измеренная стоимость инференса.
Что это меняет на практике
Для self-hosting разработчику нужно считать не «одну видеокарту», а инфраструктуру: объём памяти под веса MoE-модели зависит от общего числа параметров, а не от числа активных на токен. Базе GLM-5.x на 744 млрд параметров в FP8 нужно около 800 ГБ видеопамяти только под веса, поэтому типовая конфигурация — узел из восьми H200; для Kimi K3 Moonshot рекомендует минимум 64 ускорителя. Сверху к весам добавляются KV-кэшсохранённые в памяти промежуточные состояния внимания, чтобы не пересчитывать их при генерации каждого следующего токена, активации и служебная память движка.
В стеке инференса Hugging Face TGI с декабря 2025 года в режиме поддержки, и для новых проектов в первую очередь рассматривают vLLM или SGLang. По TCOсовокупной стоимости владения self-hosted складывается из амортизации GPU, электричества и охлаждения, хостов, сети и хранилища, резерва под отказоустойчивость, а также времени платформенной команды и SRE; TCO API — из входных и выходных токенов, кэша и вспомогательных вызовов с учётом пиковых тарифов. Особенно чувствителен коэффициент утилизации GPU: простаивающий зарезервированный ускоритель продолжает стоить денег, и реальная цена токена равна месячным затратам, делённым на фактически обслуженные токены. В опубликованных оценках для зарезервированных GPU встречается порядок 2–5 млн токенов в день как точка окупаемости собственного железа, но это не универсальный порог.
Практики миграции и fallback описываются как набор из пяти практик, где приложение не выбирает модель напрямую, а ходит в один шлюз, решение о маршруте живёт в конфигурации, а телеметрия фиксирует, что именно ответило на каждый запрос. Fallback по типу ошибки применяется при 5xxошибках на стороне сервера или таймауте соединения, пока ответ ещё не начал приходить; на 429превышении лимита запросов политика выбирает между ожиданием по Retry-Afterзаголовку ответа, указывающему, через сколько можно повторить запрос с backoff и переключением на другой бэкенд, причём резерв не должен сидеть в том же пуле квот. Если стриминг ответа уже начался, fallback перестаёт быть прозрачной заменой, поэтому запрос нужно явно завершать ошибкой; для агентных сценариев автоматический fallback на уровне шлюза отключается, а повтор решается в приложении с учётом идемпотентности и состояния вызовов. В конфигурации шлюза массовая задача без side effects идёт на self-hosted open-weight модель за vLLM, резерв — закрытая фронтир-модель через API, а eval-алиасыотдельные маршруты для прогона оценочных тестов настроены без fallback, чтобы мерить ровно одну модель. Для критичных нагрузок рекомендуется минимум два квалифицированных семейства моделей, а для неcritical сервисов второе семейство может не окупить расходы на eval и поддержку промптов.
Ограничения и открытые вопросы
Заявления Reflection о производительности Beam пока не прошли независимую проверку. Вопросы безопасности остаются открытыми: результаты оценок безопасности будут опубликованы в техническом отчёте модели, а внутренние оценки планируется открыть, чтобы экосистема могла тестировать и вносить вклад.
Дальнейшие планы включают выпуск весов под лицензией Apache 2.0 вместе с документацией и полным стеком для запуска, оценки и дообучения. Beam назван первой моделью серии, и команда уже обучает следующее поколение.