Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 19 августа 2026 г.

Новости

Liquid AI: edge-модели LFM2.5 в 4 бита без типичной просадки IQ

Квантизованная модель LFM2.5 на edge-устройстве — от Raspberry Pi до ноутбука — с высокой скоростью декодирования.

Liquid AI выложила четыре Q4_0 GGUF-чекпоинта для LFM2.5: 230M, 350M, 1.2B-Instruct и 2.6B. Их обучали сразу под 4-битную квантизацию через Quantization-Aware Distillation: полноразрядный учитель дистиллируется в квантизованного ученика, поэтому память и скорость остаются как у обычного Q4_0.

Обычная квантизация после обучения заметно просаживает качество. Liquid AI заявляет восстановление 97% BF16-точности. На GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF и BFCLv4 чекпоинты удерживают 97,1%, 96,5%, 97,4% и 96,6% полноразрядной базы; для 230M и 350M добавили GSM8K, для 1.2B и 2.6B добавили AIME25.

Скорость на реальном железе

Скорость декодирования проверили на MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. На ноуте и NucBox тестировали через GPU, на телефоне и Pi через Arm CPU.

  • 230M и 350M: качество на уровне Q5_K_M в пределах дисперсии, скорость декодирования выше на 4–33%
  • 1.2B и 2.6B: уровень Q4_K_M при приросте скорости на 3–14%
  • 230M и 1.2B сравнили с Unsloth UD-Q4_K_XL: QAD Q4_0 на том же уровне

Как запустить

Файлы работают с llama.cpp и любым рантаймом, который поддерживает GGUF Q4_0. Пример для 350M:

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

Чекпоинты уже на Hugging Face, релиз 19 августа 2026.

Источник: LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation.