Когда резать мультимодальный инференс на три этапа окупается до 5×

NVIDIA Dynamo умеет раскладывать мультимодальный инференс на три независимых этапа — и объясняет, в каких сценариях такой разнос даёт до 5× ускорения. Речь про encode-prefill-decode disaggregation (EPD): кодирование изображения отделяется от набора контекста по промпту и пошаговой генерации ответа.
Vision encoder, prefill и decode больше не сидят в одном монолите. Каждый блок можно масштабировать отдельно и поставить на своё железо, не таща соседние стадии.
Когда EPD имеет смысл
- промпты с большим объёмом изображений
- короткие и средние по длине ответы
- квантованные mixture-of-experts (MoE) модели
На длинном тексте без картинок decode забирает всё время — прирост от разноса почти пропадает. Агенты со скриншотами, OCR и короткими ответами по визуалу попадают в профиль, под который EPD и заточен.
Источник: When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving.