Перейти к содержимому
Экосистема AI Vibe

Новости

AIPerf от NVIDIA: бенчмарк LLM без самописного генератора

Редакция 19 сентября 2026 г.

Терминал с live-дашбордом AIPerf: прогресс прогона, перцентили латентности и лог воркеров нагрузочного теста LLM.

NVIDIA AIPerf заменяет GenAI-Perf и переписывает клиент для нагрузочного теста LLM-inference: воркеры в отдельных процессах шлют запросы, ответы собирают отдельные сервисы, координация через ZMQ. При конкурентной нагрузке измерение не должно упираться в GIL Python раньше, чем в GPU.

Типичная картина после деплоя: модель отвечает на промпты, а «быстро ли» проверяют curl, самописным asyncio или очередным одноразовым генератором после вайб-кода. Общая ловушка — потолок одного процесса и цифры относительно эталона, который вы сами набросали.

Что умеет инструмент

  • более 15 типов эндпоинтов — chat, responses, rankings через NIM, генерация изображений и другие;
  • датасеты ShareGPT и replay-трейсы Mooncake, Baseten, WEKA AgentX;
  • нагрузка constant, Poisson и gamma, плавный ramp по concurrency и RPS;
  • синтетика с настраиваемой длиной входа и выхода в духе vLLM и SGLang.

Установка — uv tool install aiperf. В walkthrough гоняют Qwen3-0.6B в vLLM с фиксированными 128 токенами на вход и выход; для стриминговых замеров нужен флаг --streaming, иначе TTFT и ITL в отчёте не появятся. После run — таблица в терминале, CSV и JSON: перцентили до p99, end-to-end latency, пропускная способность по выходным токенам; при DCGM или pynvml в том же прогоне видны утилизация и память GPU.

Источник: Benchmarking LLM Inference at Scale with AIPerf.