Перейти к содержимому
Экосистема AI Vibe

Новости

Confidential Computing на inference: TensorRT LLM держит 96%+ throughput

Редакция 22 сентября 2026 г.

Сравнение графиков throughput и задержки inference LLM с Confidential Computing включённым и выключенным на кластере GPU.

Inference LLM с чувствительными промптами и весами всё чаще гоняют в доверенном окружении , NVIDIA Confidential Computing как раз про это: шифрованные CVM и confidential GPU. На восьми B200 команда сравнила DeepSeek-R1 в TensorRT LLM с CC и без: throughput держится на 96,1, 98,2% от обычного режима, средняя задержка на выходной токен растёт всего на 1,2, 4,3%. Стенд , DGX B200 под Intel TDX, плюс зашифрованный NVLink между картами. Чтобы overhead не спрятался за параллелизмом, взяли жёсткий профиль: 32K токенов на входе, 1K на выходе, TP=8, KV cache в FP8, от одного до шестнадцати одновременных запросов. Длинный контекст и мало конкуренции в таких тестах показывают цену шифрования честнее, чем пиковая загрузка кластера. Где ломается рантайм В Blackwell CC данные с хоста на GPU идут через промежуточный буфер: GPU не читает защищённую память виртуалки напрямую. Pinned memory перестаёт ускорять async-копии, часть переносов блокирует поток decode. Host→device: в TensorRT LLM выбирают pageable память вместо безусловного pinned. Device→host: повторяющийся readback токенов вынесли в фоновый worker. Autotuner: под CC таймстемпы CUDA events «плывут» , тактики меряют через GPU-таймер. Multi-GPU: NVLS multicast в CC недоступен, настройку NCCL подбирают отдельно. Честное сравнение на стенде сводится к одному: тот же model, framework, длины и parallelism , меняется только флаг CC, дальше смотрят долю сохранённого throughput и относительный рост TPOT. Источник: Enabling Private High-Performance Production AI Inference with NVIDIA Confidential Computing .