4-битный GPT-OSS 60B после QAH обгоняет bfloat16 на кодинге

Сжатая вдвое и упакованная в четыре бита модель обычно проигрывает полноточной на коде. Multiverse Computing перевернула эту логику: после Quantization-Aware Healing четырёхбитный GPT-OSS 60B в MXFP4 обгоняет bfloat16 на семи из девяти бенчмарков — от агентного кодинга до вызова инструментов.
Экономия весов у всех один и тот же сценарий: режут слои и головы, квантуют остаток, потом восстанавливают качество перед релизом. Так делают gpt-oss, Nemotron и Hypernova 60B. Проблема в том, что оба шага бьют по рассуждению, математике и генерации кода.
Почему старые способы не вытягивают
Обычно берут либо дообучение с псевдоквантованием — долго и может разъехаться после пика — либо дистилляцию от полной копии модели. После структурного сжатия такой копии нет: учителем остаётся уже восстановленный bfloat16, и четырёхбитная версия не растёт выше его потолка.
Идея QAH
QAH тянет знания напрямую от оригинала до сжатия — полный 120B учит, половинный студент в MXFP4 учится через KL на логитах. Четыре бита становятся вторым проходом дистилляции, а не финальным штрафом на качество. Для контекста до 32k токенов в корпусе healing считают KL по срезам, чтобы не раздувать память на GPU.
Что на бенчмарках
- LiveCodeBench — 66.5: выше bfloat16 (65.5) и учителя 120B (66.0)
- Aider (агентный кодинг) — +2.7 против bfloat16
- AA-LCR (длинный контекст) — +7.4: 42.7 против 35.3
- τ²-bench (инструменты) — +2.3: 61.7 против 59.4
Только MMLU-Pro и SciCode проиграны меньше чем на полтора пункта. Весы в четыре бита — около четверти памяти bfloat16; половина параметров — около половины вычислений на токен относительно 120B.
Стабильность против QAT
На GPT-OSS 9B пики QAH и QAT почти равны — 54.9 и 54.6. Но QAH доходит за ~100 шагов, QAT — за ~700, а потом QAT теряет почти 19 пунктов к шагу 1200. Для продакшена это риск: QAT надо ловить ранней остановкой, QAH после пика почти не дрейфует.
Источник: Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original.