TensorRT Edge-LLM: MLPerf Agentic на Jetson Thor быстрее llama.cpp в 6,4 раза

TensorRT Edge-LLM на Jetson AGX Thor завершила MLPerf Inference v6.1 Edge Agentic в 6,4 раза быстрее эталонного llama.cpp на том же железе , 24 минуты 36 секунд против 2 часов 37 минут. Бенчмарк меряет не один ответ в чате, а полный цикл агента: запрос, вызов инструмента, ответ тула и следующий шаг в той же беседе. Здесь , 20 диалогов и 1007 ходов; контекст к финалу доходит примерно до 23,5 тысячи токенов. Отдельно проверяют точность выбора функций на BFCL v4 , у submission NVIDIA 87,94%. Откуда ускорение На edge память общая, и каждый новый ход тащит почти всю историю , runtime должен быстро поднимать KV-кэш, а не префиллить всё заново. NVIDIA сложила три слоя: 4-битные веса NVFP4 с кэшем в FP8, переиспользование готовых KV-страниц между ходами (~96% prompt-токенов из hot cache) и tree-based multi-token prediction для черновиков при function calling. Модель в прогоне , Qwen3.6-27B со скоростью 52,33 токена в секунду. Стек для воспроизведения лежит в ветке release/0.9.1-mlpinf репозитория TensorRT Edge-LLM , export с флагом --mtp-tree-base , OpenAI-compatible server и клиент под endpoints MLCommons. Источник: TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor .