Qwen 3.8 27B: сильная локальная модель, но xhigh съедает время

Alibaba выпустила Qwen 3.8 27B — vision-модель на 27B параметров под Apache 2. Simon Willison прогнал её на MacBook M5 и DGX Spark через LM Studio: квант Q4_K_M весит 17 ГБ и реально крутится на ноутбуке. Главная ловушка не в качестве, а в параметре reasoning_effort — по умолчанию xhigh, и модель тратит десятки тысяч токенов на рассуждения даже на банальные запросы.
Почему xhigh мешает
В LM Studio контекст по умолчанию — 8192 токена. С xhigh модель забивала всё окно, «думая» над простыми задачами. После загрузки с лимитом 262144 это ушло — зато проявилась цена режима.
SVG с пеликаном на велосипеде при xhigh занял 21 минуту: 22 276 токенов рассуждений на 3 223 в ответе. Без reasoning — 137 секунд и 3 715 токенов вывода. Промпт «нарисуй SVG круга» превратился в анимированную «геометрическую студию» — красиво, но не то, что просили. Willison советует стартовать с low или вовсе без reasoning.
Картинки и агенты
На фото пеликанов модель вернула JSON с bounding boxes в шкале 0–1000 — координаты совпали с объектами. Из одного промпта Qwen собрал HTML-инструмент для отрисовки рамок; с xhigh интерфейс раздулся до демо-сцены с нарисованными пеликанами. Без рассуждений почти заработало, но рамки встали не туда — здесь reasoning реально помог.
Через агент Pi с коротким системным промптом модель разобрала auth в репозитории Datasette и по запросу написала pi_jsonl_to_md.py для конвертации JSONL-транскриптов в markdown. Длинный контекст, генерация кода и вызов инструментов — для локального agent loop это рабочий вариант.
Скорость вывода
LM Studio на Spark давал 15–30 токенов в секунду — для экспериментов терпимо, до облачных API далеко. Willison запустил модель через llama serve с Multi-Token Prediction (--spec-type draft-mtp) и получил прирост около 72% против дефолтного GGUF в LM Studio.
17 ГБ на домашнем железе уже тянут vision, код и tool calling — но xhigh по умолчанию и медленный inference пока не дают сделать модель ежедневным драйвером без ручной настройки.
Источник: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things.