Liquid AI добавила к своей визуально-языковой модели LFM2.5-VL-3B черновую модель для спекулятивного декодированияметод ускорения генерации, при котором лёгкая draft-модель предлагает несколько следующих токенов, а целевая модель их проверяет. Артефакт называется LFM2.5-VL-DSpark и доступен на Hugging Face с поддержкой в llama.cpp, SGLang и MLX-VLM.
Новая модель добавляет 280M параметров — 8,9% от целевых 3B. Авторы заявляют ускорение декодирования до 3,13x на устройствах и 2,66x на H100 при сквозном выигрыше до 2,62x и 2,27x соответственно.
Что именно изменилось
DSpark — это draft-модельвспомогательная модель, которая предсказывает несколько следующих токенов, а целевая модель затем проверяет их за один проход. Она использует скрытые состояния целевой модели на разных слоях, чтобы предсказывать следующие k токенов. Для самой draft-модели модальность входа не важна: к моменту попадания в скрытые слои текст и патчи изображения уже представлены многомерными тензорами. Поэтому к визуально-языковым моделям применяется тот же алгоритм инференса, что и к текстовым.
Архитектура драфтера — упрощённая attention-only. Число слоёв и размер блокачисло токенов, которые драфтер предлагает за один шаг и которые целевая модель затем проверяет за один проход подбирались абляциями; в итоге выбраны 4 слоя и размер блока 9. Итоговый размер драфтера — 279,5M параметров, из которых 193,0M приходятся на стек декодера из 4 слоёв, 21,0M — на проекцию скрытого состояния, 65,5M — на голову Марковакомпонент, который предсказывает следующий токен с учётом уже предложенных драфтером токенов, 6,4k — на нормы вместе с головой уверенностикомпонентом, который оценивает, насколько драфтер уверен в каждом предложенном токене. Эмбеддинги и LM-голова привязаны к целевой модели и в состав драфтера не входят.
Спекулятивное декодирование ускоряет только фазу декодирования. Кодирование изображения и префиллобработка входного промпта до начала генерации остаются без изменений.
Предыстория
DSpark для зрения построен на том же концепте, что и ранее выпущенные текстовые draft-модели LFM2.5-DSpark. Спекулятивное декодирование использует скрытые состояния модели на разных слоях для предсказания следующих k токенов лёгкой draft-моделью.
Ограничение подхода — закон Амдала: когда не ускоренные этапы уже занимают значительную долю времени, даже большое ускорение декодирования даёт лишь скромное улучшение сквозной задержкивремени от подачи запроса до получения полного ответа, поскольку общее ускорение ограничено долей рабочей нагрузки, которая остаётся неускоренной.
DSpark опирается на четыре работы: Cheng et al. (2026) о самом DSpark, Shen et al. (2026) с бенчмарком MMSpec для спекулятивного декодирования в визуально-языковых моделях, Leviathan et al. (2023) о быстром выводе трансформеров через спекулятивное декодирование и Apple Machine Learning Research (2025) об исследовании LLM с MLX и Neural Accelerators в M5 GPU.
Почему это сделали
На edge-устройствах меньше вычислений, чем на датацентровых GPU, поэтому префилл занимает большую долю сквозной задержки. Визуально-языковые модели усугубляют это: изображение сначала проходит через vision encoderчасть модели, которая превращает изображение в набор визуальных токенов, после чего языковой бэкбон обрабатывает сотни визуальных токенов вместе с текстовым промптом. Спекулятивное декодирование ускоряет только декодирование, но не vision encodingэтап обработки изображения моделью и не префилл.
Авторы приводят замеры пропускной способности при batch sizeчисле запросов, обрабатываемых моделью одновременно. На устройстве с MLX на M5 Max декодирование ускоряется в 2,30x–3,13x по задачам, сквозная задержка улучшается в 1,56x–2,62x. С llama.cpp на M3 Ultra декодирование улучшается в 1,57x–2,14x, сквозная — в 1,30x–1,77x. На GPU с SGLang на одной H100 80GB в BF16 декодирование ускоряется в 2,04x–2,66x, сквозная — в 1,64x–2,27x.
При большей конкурентностичисле одновременных запросов к модели DSpark сохраняет преимущество по пропускной способности на всех измеренных уровнях, хотя разрыв сужается по мере её роста. Все тесты проводились в SGLang на одной H100 с фиксированным окном верификации.
Что это меняет на практике
Спекулятивное декодирование является точным: целевая модель проверяет каждый предложенный токен, поэтому жадный выводвыбор на каждом шаге самого вероятного токена без случайности совпадает с выводом одной целевой модели. При ненулевой температурепараметре сэмплирования, задающем степень случайности выбора токенов драфтер сэмплирует токен, а цель либо принимает его, либо делает исправленную замену. При согласованных настройках сэмплирования спекулятивное декодирование эквивалентно по распределению прямому сэмплированию из целевой модели, поэтому вывод остаётся без потерь.
Размер блока читается из двух разных мест в зависимости от контекста: из config.json черновика либо из метаданных-сайдкарасопроводительного файла с дополнительными параметрами рядом с моделью, при этом значение n-maxверхней границы числа одновременно предлагаемых токенов ограничивается этим размером блока. В timings на каждый ответ отчёт ведётся по draft_n / draft_n_accepted — числу предложенных драфтером токенов и числу принятых целевой моделью.
Для запуска через SGLang нужно вызвать python -m sglang.launch_server с параметрами --model-path LiquidAI/LFM2.5-VL-3B, --speculative-algorithm DSPARK, --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark, --speculative-draft-attention-backend flashinfer, --speculative-dspark-block-size 9 и --disable-radix-cache (отключает переиспользование общего префикса между запросами, чтобы оно не мешало спекулятивному декодированию). Для llama.cpp используется llama-server с флагами -m, --mmproj, -md, --spec-type draft-dspark, --spec-draft-n-max 8, --spec-draft-n-min 0, -fa on, -ngl 99 и -c 8192. Для MLX-VLM команда — mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark.
Ограничения и открытые вопросы
Авторы признают, что спекулятивное декодирование ускоряет только фазу декодирования, а кодирование изображения и префилл остаются без изменений, поэтому при большой их доле общий выигрыш ограничен законом Амдала. На edge-устройствах префилл занимает ещё большую долю сквозной задержки из-за низкой вычислительной пропускной способности.
При ненулевой температуре драфтер сэмплирует токен, и рост температуры снижает долю принятия, что негативно влияет на пропускную способность, хотя при согласованных настройках сэмплирования вывод остаётся без потерь. Ускорение квантованных моделей остаётся вне рамок этого релиза.
Для запуска через llama.cpp, MLX-VLM и SGLang требуются специальные сборки этих фреймворков с поддержкой DSpark.