Перейти к содержимому
Экосистема AI Vibe

Новости

Когда резать мультимодальный инференс на три этапа окупается до 5×

Редакция 10 сентября 2026 г.

Три этапа мультимодального инференса — кодирование изображения, префилл и декодирование — разнесены по отдельным вычислительным блокам.

NVIDIA Dynamo умеет раскладывать мультимодальный инференс на три независимых этапа — и объясняет, в каких сценариях такой разнос даёт до 5× ускорения. Речь про encode-prefill-decode disaggregation (EPD): кодирование изображения отделяется от набора контекста по промпту и пошаговой генерации ответа.

Vision encoder, prefill и decode больше не сидят в одном монолите. Каждый блок можно масштабировать отдельно и поставить на своё железо, не таща соседние стадии.

Когда EPD имеет смысл

  • промпты с большим объёмом изображений
  • короткие и средние по длине ответы
  • квантованные mixture-of-experts (MoE) модели

На длинном тексте без картинок decode забирает всё время — прирост от разноса почти пропадает. Агенты со скриншотами, OCR и короткими ответами по визуалу попадают в профиль, под который EPD и заточен.

Источник: When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving.