DSpark ускоряет LFM2.5 до 3.2× на MacBook и H100 без потери качества

Liquid AI выпустила черновые чекпоинты DSpark для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B: лёгкий draft (~300M параметров) предлагает пачку токенов, основная проверяет их одним проходом и делит стоимость загрузки весов из памяти. При greedy-декоде последовательность совпадает с baseline, pass@1 и exact match не меняются.
Большая часть задержки при decode: не вычисления, а поток весов из DRAM. DSpark соединяет параллельный backbone, Markov-голову между соседними токенами и verifier, который отсекает слабые суффиксы, когда проверка дороже выигрыша. Draft насчитывает 5 слоёв, block size 9; обучали 15 эпох на SFT, чате, коде и function-calling, в прод пошла эпоха с максимальным acceptance rate.
Ускорение на GPU и MacBook
На H100 через SGLang для LFM2.5-2.6B средний прирост 2.67×: с 323 до 864 tok/s (BF16, batch 1). На M4 Max через llama.cpp с Metal: 2.27× (61 → 139 tok/s). Для LFM2.5-8B-A1B пик на H100: 3.18× на MATH500 (428 → 1362 tok/s).
В multi-tool сценариях latency function calling для LFM2.5-2.6B падает в среднем на 57%. На MacBook модель 2.6B выдаёт порядка ~140 tok/s, для интерактивного агента это заметный скачок.
Как запустить
Поддержка в день релиза в llama.cpp (PR #27383) и SGLang (PR #31041). Block size читается из конфига draft-модели; speculative decoding exact: отклонённые токены заменяет target-модель, в таймингах видны draft_n и draft_n_accepted.
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-2.6B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
--speculative-draft-attention-backend flashinfer \
--disable-radix-cache --mem-fraction-static 0.75 --port 30000Чекпоинты на Hugging Face в Safetensors и GGUF: LFM2.5-2.6B-DSpark, LFM2.5-1.2B-Instruct-DSpark, LFM2.5-8B-A1B-DSpark.
Источник: Up to 3.2x Faster Inference with LFM2.5-DSpark.