Назад к блогу

Liquid AI выпустила черновую модель DSpark для визуально-языковой LFM2.5-VL-3B

Liquid AI выпустила черновую модель DSpark для визуально-языковой LFM2.5-VL-3B

Liquid AI представила лёгкую draft-модель для спекулятивного декодирования своей визуально-языковой LFM2.5-VL-3B — она добавляет всего около 280 млн параметров к целевой модели. Прирост скорости декодирования достигает трёхкратного на устройствах и примерно 2,7x на H100, причём вывод остаётся эквивалентным обычному по распределению, то есть без потери качества.

Liquid AI добавила к своей визуально-языковой модели LFM2.5-VL-3B черновую модель для спекулятивного декодирования. Артефакт называется LFM2.5-VL-DSpark и доступен на Hugging Face с поддержкой в llama.cpp, SGLang и MLX-VLM.

Новая модель добавляет 280M параметров — 8,9% от целевых 3B. Авторы заявляют ускорение декодирования до 3,13x на устройствах и 2,66x на H100 при сквозном выигрыше до 2,62x и 2,27x соответственно.

Что именно изменилось

DSpark — это draft-модель. Она использует скрытые состояния целевой модели на разных слоях, чтобы предсказывать следующие k токенов. Для самой draft-модели модальность входа не важна: к моменту попадания в скрытые слои текст и патчи изображения уже представлены многомерными тензорами. Поэтому к визуально-языковым моделям применяется тот же алгоритм инференса, что и к текстовым.

Архитектура драфтера — упрощённая attention-only. Число слоёв и размер блока подбирались абляциями; в итоге выбраны 4 слоя и размер блока 9. Итоговый размер драфтера — 279,5M параметров, из которых 193,0M приходятся на стек декодера из 4 слоёв, 21,0M — на проекцию скрытого состояния, 65,5M — на голову Маркова, 6,4k — на нормы вместе с головой уверенности. Эмбеддинги и LM-голова привязаны к целевой модели и в состав драфтера не входят.

Спекулятивное декодирование ускоряет только фазу декодирования. Кодирование изображения и префилл остаются без изменений.

Предыстория

DSpark для зрения построен на том же концепте, что и ранее выпущенные текстовые draft-модели LFM2.5-DSpark. Спекулятивное декодирование использует скрытые состояния модели на разных слоях для предсказания следующих k токенов лёгкой draft-моделью.

Ограничение подхода — закон Амдала: когда не ускоренные этапы уже занимают значительную долю времени, даже большое ускорение декодирования даёт лишь скромное улучшение сквозной задержки, поскольку общее ускорение ограничено долей рабочей нагрузки, которая остаётся неускоренной.

DSpark опирается на четыре работы: Cheng et al. (2026) о самом DSpark, Shen et al. (2026) с бенчмарком MMSpec для спекулятивного декодирования в визуально-языковых моделях, Leviathan et al. (2023) о быстром выводе трансформеров через спекулятивное декодирование и Apple Machine Learning Research (2025) об исследовании LLM с MLX и Neural Accelerators в M5 GPU.

Почему это сделали

На edge-устройствах меньше вычислений, чем на датацентровых GPU, поэтому префилл занимает большую долю сквозной задержки. Визуально-языковые модели усугубляют это: изображение сначала проходит через vision encoder, после чего языковой бэкбон обрабатывает сотни визуальных токенов вместе с текстовым промптом. Спекулятивное декодирование ускоряет только декодирование, но не vision encoding и не префилл.

Авторы приводят замеры пропускной способности при batch size. На устройстве с MLX на M5 Max декодирование ускоряется в 2,30x–3,13x по задачам, сквозная задержка улучшается в 1,56x–2,62x. С llama.cpp на M3 Ultra декодирование улучшается в 1,57x–2,14x, сквозная — в 1,30x–1,77x. На GPU с SGLang на одной H100 80GB в BF16 декодирование ускоряется в 2,04x–2,66x, сквозная — в 1,64x–2,27x.

При большей конкурентности DSpark сохраняет преимущество по пропускной способности на всех измеренных уровнях, хотя разрыв сужается по мере её роста. Все тесты проводились в SGLang на одной H100 с фиксированным окном верификации.

Что это меняет на практике

Спекулятивное декодирование является точным: целевая модель проверяет каждый предложенный токен, поэтому жадный вывод совпадает с выводом одной целевой модели. При ненулевой температуре драфтер сэмплирует токен, а цель либо принимает его, либо делает исправленную замену. При согласованных настройках сэмплирования спекулятивное декодирование эквивалентно по распределению прямому сэмплированию из целевой модели, поэтому вывод остаётся без потерь.

Размер блока читается из двух разных мест в зависимости от контекста: из config.json черновика либо из метаданных-сайдкара, при этом значение n-max ограничивается этим размером блока. В timings на каждый ответ отчёт ведётся по draft_n / draft_n_accepted — числу предложенных драфтером токенов и числу принятых целевой моделью.

Для запуска через SGLang нужно вызвать python -m sglang.launch_server с параметрами --model-path LiquidAI/LFM2.5-VL-3B, --speculative-algorithm DSPARK, --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark, --speculative-draft-attention-backend flashinfer, --speculative-dspark-block-size 9 и --disable-radix-cache (отключает переиспользование общего префикса между запросами, чтобы оно не мешало спекулятивному декодированию). Для llama.cpp используется llama-server с флагами -m, --mmproj, -md, --spec-type draft-dspark, --spec-draft-n-max 8, --spec-draft-n-min 0, -fa on, -ngl 99 и -c 8192. Для MLX-VLM команда — mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark.

Ограничения и открытые вопросы

Авторы признают, что спекулятивное декодирование ускоряет только фазу декодирования, а кодирование изображения и префилл остаются без изменений, поэтому при большой их доле общий выигрыш ограничен законом Амдала. На edge-устройствах префилл занимает ещё большую долю сквозной задержки из-за низкой вычислительной пропускной способности.

При ненулевой температуре драфтер сэмплирует токен, и рост температуры снижает долю принятия, что негативно влияет на пропускную способность, хотя при согласованных настройках сэмплирования вывод остаётся без потерь. Ускорение квантованных моделей остаётся вне рамок этого релиза.

Для запуска через llama.cpp, MLX-VLM и SGLang требуются специальные сборки этих фреймворков с поддержкой DSpark.

Источники

Похожее