3 октября 2026 года Aleph Alpha выпустила Kolibri — открытую по весам большую языковую модель для немецкого и английского языков под лицензией Apache 2.0. Веса опубликованы на Hugging Face, обучение шло с нуля на инфраструктуре в Германии и Финляндии. Релиз приурочен ко Дню германского единства.
Модель — смесь экспертовархитектура, в которой на каждый токен активируется лишь часть параметров модели с 78 млрд параметров, из которых около 3,5 млрд работают на каждом токене. Заявленный контекст — до 1 млн токенов. Одновременно опубликована Kolibri Origin — предыдущая модель, потребовавшая примерно втрое меньше токенов при обучении.
Что именно выпустили
Доступны две модели: Kolibri и Kolibri Origin. Kolibri — это смесь экспертов с 78 млрд общих параметров, из которых около 3 млрд активны на каждом токене. Сколько параметров у Kolibri Origin, не сообщается, поэтому сравнить модели по этому показателю нельзя.
Веса Kolibri открыты под Apache 2.0, поэтому их можно скачать, запустить, дообучить и строить на них продукты. Лицензия покрывает веса и файлы конфигурации, а права на обучающий код и методы Aleph Alpha оставляет за собой. Модель доступна под именем Aleph-Alpha/Kolibri-1.
Токенизатор: словарь на 128 000 токенов и алгоритм UniBPE
Токенизаторкомпонент, который разбивает входной текст на куски — токены, с которыми работает модель Kolibri имеет словарь из 128 000 токенов. Обучен он новым алгоритмом UniBPE, который Aleph Alpha описывает как комбинацию двух подходов к обучению токенизаторов: BPE и Unigram. UniBPE сохраняет восходящий (bottom-up) подход BPE — постепенное слияние мелких единиц в более крупные, — но выбор каждого очередного слияния для добавления в словарь делает по целевой функции Unigram.
Практический эффект заметнее всего на немецком. Для немецкого текста токенизатору Kolibri нужно на 11,2% меньше токенов, чем токенизатору GPT-5, а на юридическом немецком — на 15% меньше; в английском он с GPT-5 сравнялся. Длинное немецкое слово «Bundesverfassungsgericht» Kolibri разбивает на 2 токена — «Bundes» и «verfassungsgericht», тогда как o200k_base (GPT-5) — на 6: «Bund», «es», «ver», «fass», «ungs», «gericht». Меньше токенов означает меньше шагов для чтения или записи того же текста и больше немецкого в том же контекстном окне.
Пост-тренировка: два этапа и обучение воздержанию
Пост-тренировка проходила в два этапа. Первый — supervised fine-tuningдообучение на размеченных примерах «вход — правильный ответ»: модель учили базовым навыкам рассуждения и взаимодействию в чате. Для этого сгенерировали 174B токенов синтетических данных, отфильтровали их по качеству и объединили с отфильтрованными открытыми датасетами с разрешительной лицензией, получив обучающую смесь из 268B токенов.
Второй этап — крупномасштабное обучение с подкреплениемобучение, где модель улучшается по сигналу награды за свои ответы на более чем 1,2 млн курируемых задач из разных доменов: рассуждения по коду и математике, агентные задачи, следование инструкциям, ответы на вопросы, вызов инструментов. Обучение асинхронное: данные генерируются на окружениях текущей моделью параллельно с обучением модели на уже сгенерированных данных. На обоих этапах модель учили рассуждать с разными уровнями усилий (none, low, medium, high), что даёт пользователю контроль над тем, сколько вычислений тратится на решение.
Отдельная линия работы — обучение воздержанию от ответа. Модель тренируют на примерах, где правильный ответ — «I don't know». Дополнительно применяется процедура Merlin-Arthur: она создаёт синтетические негативные примеры из доступных документов, эксплуатируя слабости модели на каждом шаге обучения. Негативные примеры — это задания, на которых модель подталкивают ответить там, где надёжной опоры для ответа нет; на них модель учится не выдумывать, а воздерживаться. В процедуре три участника: Arthur — обучаемая модель; Merlin берёт существующий контекст документа и генерирует новый, повышающий вероятность правильного ответа Arthur; Morgana создаёт пример, удаляя из документа релевантное доказательство, и пытается подтолкнуть Arthur к галлюцинации. Arthur не знает, с кем имеет дело, поэтому его стратегия — внимательно читать вопрос и контекст, чтобы отвечать на контексте Merlin и распознавать, что воздержание строго обязательно для урезанного контекста Morgana.
После fine-tuning Kolibri воздерживается вместо неверного ответа на 44% пунктов AA-Omniscience — бенчмарка, проверяющего ответы по памяти; процент означает долю пунктов, где модель предпочла воздержаться, а не ответить неверно (у Kolibri Origin — 15%). На RGB Kolibri чаще удерживается от ответа (86% против 74%) и реже изобретает ложные утверждения (87% против 76%). По M/A grounding score — показателю того, насколько ответы опираются на предоставленный контекст, — Kolibri достигает 0.23, тогда как Kolibri Origin и некоторые другие модели достигают 0.
Предыстория: пайплайн, абляции и немецкие данные
Работа над пайплайном началась в январе. Обучение Kolibri Origin завершило предварительную тренировку на целевом масштабе 11 июня, на что ушло пять месяцев и сотни прогонов абляцийотдельных запусков обучения, по результатам которых принимают решения об архитектуре и данных. Пайплайн применялся и для основного обучения, и для этих сотен абляций.
Немецкие данные собирались тремя способами. Первый — собственная курирующая обработка German из Common Crawl через пайплайн, специализированный под немецкий. Параметры фильтрации пришлось перенастроить: стандартные настройки, например удаление документов со слишком длинными словами, тихо вычищают административный регистр, поскольку немецкая административная проза регулярно превышает английский порог средней длины слова. После перенастройки пайплайн дал 1,3T уникальных токенов органического немецкого веба.
Второй способ — перефразирование уже имевшихся немецких документов LLM в стиле энциклопедической статьи, диалога Q&A или текстового пассажа с сохранением содержания. Это дало около 1T уникальных токенов и стало крупнейшим источником немецкого в модели. Третий — перевод с английского, применявшийся только в Kolibri Origin.
Итоговый немецкий пул — 2,4T уникальных токенов, на 80% курированных или сгенерированных самостоятельно и на 20% из открытых датасетов. Модель видела немецкий на 21,3% токенов предобучения, примерно 4,3T за прогон в 20T через upsampling. Каждый немецкий токен встречался в среднем 1,8 раза.
Почему модель называют «суверенной»
Aleph Alpha использует слово «суверенный» в двух смыслах. Первый — как модель построена: команды работали в Германии, обучение шло на инфраструктуре в Германии и Финляндии, по европейскому и немецкому праву, без иностранного контроля. Второй — что получает заказчик: полную свободу развёртывания и защиту интеллектуальной собственности, так что соответствие требованиям становится унаследованным свойством модели.
Суверенная модель — та, которую организация может запускать целиком на контролируемой ею инфраструктуре, по обязательным для неё законам, так что данные остаются у неё и никто другой не может изменить или отключить модель. Контроль над сквозным конвейером — от курирования данных через пре- и пост-тренировку до оптимизации в Model Factory — лежит в основе суверенности и передаётся заказчикам. При этом суверенность не означает, что в модель не попало ничего из-за пределов Европы.
Модель строилась с учётом EU AI Act, General-Purpose AI Code of Practice и GDPR с самого начала, при этом авторское право было отдельным фокусом. Это выразилось в прозрачности весов и курирования обучающих данных, объяснимости через reasoning traces и надёжности через протокол Merlin-Arthur. Aleph Alpha также подписала GPAI Code of Practice Евросоюза.
Как запустить
Клиентская библиотека ставится командой pip install "aleph-alpha-inference>=1.0". Сервер поднимается через vLLM с включёнными парсерами рассуждений и вызовов инструментов:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choiceФлаг --kv-cache-dtype fp8 задаёт тип данных fp8 для KV-кэша, --reasoning-parser kolibri1 подключает парсер рассуждений, --tool-call-parser kolibri1 — парсер вызовов инструментов, --enable-auto-tool-choice включает автоматический выбор инструментов. Получается OpenAI-совместимый сервер, поэтому с ним работает любой OpenAI-клиент.
Model card рекомендует параметры генерации temperature=1.0, top_p=0.97 и top_k=128, а для чувствительных к задержке случаев — контексты не более 262 144 токенов. Чтобы обслуживать контексты свыше этого, нужно добавить --max-model-len 1048576 и --hf-overrides '{"max_position_embeddings": 1048576}'.
Уровень усилий рассуждения передаётся через chat-шаблон: в OpenAI-клиенте в extra_body передаётся chat_template_kwargs с полями reasoning_effort и enable_thinking. Поле reasoning_effort задаёт уровень усилий, с которым модель рассуждает, — те же уровни none, low, medium и high, которым модель обучена; поле enable_thinking включает режим рассуждения. Клиент создаётся с base_url http://localhost:8000/v1 и api_key EMPTY.
Что это меняет на практике
Kolibri стоит выбирать, когда важны немецкий текст и собственное оборудование: например, для госоргана, банка, производителя или аэрокосмического поставщика, обязанного держать документы внутри. RAG по длинным немецким документам — законам, контрактам, руководствам — использует все сильные стороны модели: токенизатор, контекст в 1 млн токенов и воздержание от ответа.
По бенчмаркам Kolibri превосходит Kolibri Origin почти везде: AIME 2025 — 96.9 против 81.9, GPQA (diamond) — 84.3 против 68.1, τ³-bench banking — 38.1 против 5.7. Среди открытых моделей сопоставимого размера Kolibri лидирует по Overall (EN) 75.5 против 74.7 у Qwen3.5 35B-A3B и по Overall (DE) 70.8 против 69.8 у Qwen3.5 35B-A3B. На AIME 2025 (EN) Kolibri набирает 96.9, тогда как Nemotron 3 Nano — 89.6, а Mistral Small 4 119B-A6B — 79.8. На Honeypot Kolibri (80.8) обходит Mistral Small 4 119B-A6B (68.1), а на MuSiQue (cleaned) Kolibri уступает только Nemotron 3 Super (79.1).
Ограничения и открытые вопросы
Модель знает меньше по памяти: она последняя из 12 моделей на закрытом тесте (51.0) и отвечает правильно лишь на 14.8% вопросов Omniscience против 22.2% у Qwen3.5 35B-A3B. Слабее у неё многоходовой вызов инструментов: BFCL v3 (multi-turn) — 39.8 против 58.2 у GLM-4.7 Flash и 54.0 у Qwen3.5 35B-A3B. В агентном кодинге TerminalBench 2.1 Kolibri набирает 27.7 против 39.7 у Qwen3.5 35B-A3B. Длинный контекст проседает в середине: на 128 000 токенов RULER Qwen3.5 набирает 89.9 против 67.9 у Kolibri, и Kolibri выходит вперёд только на самом длинном конце.
Ограничение по языкам — только немецкий и английский, и это сделано намеренно: model card называет это «осознанным выбором глубины вместо ширины». Kolibri — неправильный выбор для кодинг-агента, для вопросов, на которые модель должна отвечать по памяти, для любого языка кроме немецкого и английского, и для тех, у кого нет 78 ГБ видеопамяти.