Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 20 августа 2026 г.

Новости

DSpark ускоряет LFM2.5 до 3.2× на MacBook и H100 без потери качества

Черновая модель DSpark предлагает токены, основная LFM2.5 проверяет их пакетом — ускорение inference на ноутбуке и GPU.

Liquid AI выпустила черновые чекпоинты DSpark для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B: лёгкий draft (~300M параметров) предлагает пачку токенов, основная проверяет их одним проходом и делит стоимость загрузки весов из памяти. При greedy-декоде последовательность совпадает с baseline, pass@1 и exact match не меняются.

Большая часть задержки при decode: не вычисления, а поток весов из DRAM. DSpark соединяет параллельный backbone, Markov-голову между соседними токенами и verifier, который отсекает слабые суффиксы, когда проверка дороже выигрыша. Draft насчитывает 5 слоёв, block size 9; обучали 15 эпох на SFT, чате, коде и function-calling, в прод пошла эпоха с максимальным acceptance rate.

Ускорение на GPU и MacBook

На H100 через SGLang для LFM2.5-2.6B средний прирост 2.67×: с 323 до 864 tok/s (BF16, batch 1). На M4 Max через llama.cpp с Metal: 2.27× (61 → 139 tok/s). Для LFM2.5-8B-A1B пик на H100: 3.18× на MATH500 (428 → 1362 tok/s).

В multi-tool сценариях latency function calling для LFM2.5-2.6B падает в среднем на 57%. На MacBook модель 2.6B выдаёт порядка ~140 tok/s, для интерактивного агента это заметный скачок.

Как запустить

Поддержка в день релиза в llama.cpp (PR #27383) и SGLang (PR #31041). Block size читается из конфига draft-модели; speculative decoding exact: отклонённые токены заменяет target-модель, в таймингах видны draft_n и draft_n_accepted.

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-2.6B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --disable-radix-cache --mem-fraction-static 0.75 --port 30000

Чекпоинты на Hugging Face в Safetensors и GGUF: LFM2.5-2.6B-DSpark, LFM2.5-1.2B-Instruct-DSpark, LFM2.5-8B-A1B-DSpark.

Источник: Up to 3.2x Faster Inference with LFM2.5-DSpark.