Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 10 августа 2026 г.

Новости

Дистилляция LLM на одной GPU: offline-кэш и chunked KL loss

Компактная студент-модель учится на кэше логитов учителя без полной матрицы словаря в VRAM при дистилляции LLM.

Дистилляция большой LLM в компактную модель обычно требует сотен гигабайт VRAM: при контексте 32K и словаре 201 088 токенов у gpt-oss-120b один тензор вероятностей учителя — уже около 50GB, а пик итерации доходит примерно до 250GB. Multiverse Computing показала, как уложить тот же прогон на одну H200 — offline-кэш top-100 логитов и fused chunked KL loss без полной матрицы «словарь × длина контекста».

Где утекает память

Классическая online-дистилляция держит учителя и студента в памяти и на каждом шаге пересчитывает полное распределение по словарю — хотя поведение teacher в рамках одного run не меняется. Для gpt-oss-120b при batch 4 и sequence 32K dense KL в реализациях вроде PyTorch даёт пик выше 141GB H200 — обучение просто не стартует.

Два приёма

  • Offline-кэш — учитель считается один раз, сохраняются 100 самых вероятных токенов на позицию; во время training teacher не сидит в VRAM и тот же кэш можно гонять в разных ablation.
  • Fused chunked KL — loss считается по кускам контекста: hidden states проецируются в логиты только для chunk, результат входит в running loss, chunk выбрасывается. Backward пересчитывает chunk на лету — пик памяти растёт линейно с длиной контекста, а не как vocabulary × sequence.

Реализацию выложили в github.com/CompactifAI/Full-Chunked-KL-Loss.

Что на одной карте

На одной H200 с Llama 3.1 8B Instruct как teacher и студентом 3.2B при контексте 8K все четыре схемы — online, dense KL, forward-chunked и fused chunked — дают почти одинаковый training loss. Пик памяти: online 102.8 GB, fused chunked 58.3 GB.

На 32K в изолированном бенчмарке dense loss — 85.2 GiB, fused chunked — 5.45 GiB (в 15.6 раз меньше). Дистилляция GPT-OSS 20B при 32 768 токенов: с четырёх GPU-нод до одной, step time с 57.0 до 12.23 с, throughput с 74.2 до 345.7 TFLOP/s на GPU.

Студент 3.2B из Llama 3.1 8B Instruct удерживает большую часть accuracy на BoolQ и HellaSwag, на MMLU — в пределах ~9 пунктов от teacher при менее половине параметров.

Источник: Making Knowledge Distillation Cheap Enough to Run at Scale.