Liquid AI: edge-модели LFM2.5 в 4 бита без типичной просадки IQ

Liquid AI выложила четыре Q4_0 GGUF-чекпоинта для LFM2.5: 230M, 350M, 1.2B-Instruct и 2.6B. Их обучали сразу под 4-битную квантизацию через Quantization-Aware Distillation: полноразрядный учитель дистиллируется в квантизованного ученика, поэтому память и скорость остаются как у обычного Q4_0.
Обычная квантизация после обучения заметно просаживает качество. Liquid AI заявляет восстановление 97% BF16-точности. На GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF и BFCLv4 чекпоинты удерживают 97,1%, 96,5%, 97,4% и 96,6% полноразрядной базы; для 230M и 350M добавили GSM8K, для 1.2B и 2.6B добавили AIME25.
Скорость на реальном железе
Скорость декодирования проверили на MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. На ноуте и NucBox тестировали через GPU, на телефоне и Pi через Arm CPU.
- 230M и 350M: качество на уровне Q5_K_M в пределах дисперсии, скорость декодирования выше на 4–33%
- 1.2B и 2.6B: уровень Q4_K_M при приросте скорости на 3–14%
- 230M и 1.2B сравнили с Unsloth UD-Q4_K_XL: QAD Q4_0 на том же уровне
Как запустить
Файлы работают с llama.cpp и любым рантаймом, который поддерживает GGUF Q4_0. Пример для 350M:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"Чекпоинты уже на Hugging Face, релиз 19 августа 2026.
Источник: LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation.