Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 28 июля 2026 г.

Новости

Liquid AI выложила энкодеры LFM2.5: длинный контекст без GPU

Ноутбук на CPU обрабатывает длинный документ энкодером LFM2.5, пока рядом лежит стопка договоров и логов поддержки.

Liquid AI выложила на Hugging Face два открытых энкодера — LFM2.5-Encoder-230M и LFM2.5-Encoder-350M — для классификации и других задач понимания текста без генеративной LLM. Оба работают с контекстом 8192 токена и рассчитаны на сценарии, которые крутятся на CPU целый день: маршрутизация промптов, линтинг по правилам, детекция персональных данных.

Скорость на длинных текстах

При полном контексте 230M-версия укладывается примерно в 28 секунд на один проход — ModernBERT-base на той же длине тратит больше полутора минут, разница около 3.7×. Задержка у LFM2.5 растёт медленнее по мере удлинения входа: договор, транскрипт созвона или длинный тред поддержки можно прогнать на ноутбучном CPU меньше чем за полминуты.

Качество и устройство

LFM2.5-Encoder-350M занял четвёртое место среди 14 моделей на GLUE, SuperGLUE и мультиязычной классификации — выше только более крупные, в том числе 3.5B почти в 10 раз больше. 230M обходит ModernBERT-base и все EuroBERT при меньшем размере. Модели собраны из декодерных бэкбонов LFM2.5: двунаправленное внимание, masked language modeling с маской на 30% токенов, сначала обучение на 1024 токенах, потом адаптация под 8192.

Демо на CPU

На Hugging Face Spaces авторы показали задачи без GPU:

  • zero-shot prompt routing — сравнение промпта с маршрутами в свободном тексте за один проход
  • zero-shot policy linting — проверка каждого токена по правилам компании
  • PII detection — поиск и удаление 40 типов персональных данных на 16 языках
  • spell checking — посимвольная коррекция опечаток

Как подключить

Веса уже на Hugging Face. Загрузка через transformers с trust_remote_code=True: AutoModelForMaskedLM для masked-token prediction, AutoModel — если нужна своя голова классификации. 350M — когда важнее точность; 230M — когда нужен больший throughput или слабее железо. Для длинных юридических документов есть туториал по fine-tuning на контексте 8k.

Источник: LFM2.5-Encoders for Fast Long-Context Inference on CPU.