На GPU-кластере round-robin дороже модели: AWS дала умный шлюз для inference

Round-robin и least-connections на GPU-кластере не видят, чем занята реплика: переполнен ли KV-cache, стоит ли в очереди длинный контекст, загружен ли нужный LoRA-адаптер. Запросы копятся на занятых подах, при всплесках задержка до первого токена уходит за 4 секунды. AWS выпустила SageMaker HyperPod Inference Gateway — Kubernetes-аддон для EKS на HyperPod, который роутит inference по сигналам с GPU без смены model server и клиента.
В примере из блога пользователь чата ждал первый токен 4,4 с; с шлюзом — меньше 800 мс. Относительно наивной балансировки заявляют улучшение first-token latency до 82%.
Как выбирается под
Первый уровень — per-cluster gateway как managed addon amazon-sagemaker-hyperpod-inference. Стек на Gateway API Inference Extension: Envoy принимает HTTPS, Body-Based Router читает поле model в OpenAI-совместимом JSON и отправляет в нужный пул, Endpoint Picker тянет метрики Prometheus с подов и считает взвешенный score.
- загрузка KV-cache — не слать на почти полную память;
- глубина очереди и число активных запросов;
- LoRA adapter residency — предпочитать под, где адаптер уже в GPU;
- prefix cache hit rate — для мультитуровых чатов и document Q&A;
- веса настраиваются под чат или batch.
Конфиг — custom resource InferenceGatewayConfig (версия аддона в гайде: v2.0.0-eksbuild.1). Снаружи обычный /v1/chat/completions; vLLM, SGLang и TGI не трогаете. Второй уровень — Global Inference Router для кросс-кластера и регионов, в том числе failover кластера примерно за 35 с — пока в roadmap.
Где прирост заметен
AWS гоняла модели от 8B до 235B на p5 (H100) и g5 (A10G), default-настройки шлюза без ручного тюнинга. На смешанных поколениях GPU у Llama-3.1-8B TTFT P95 и P99 около −97%, у Qwen3-32B throughput +50%. На bursty-трафике у Llama-3.1-70B TTFT P95 −94%, P99 −98%. На общих префиксах промпта у 8B TTFT P95 −26%, P99 −43%.
На однородном флоте при ровной нагрузке разница с round-robin в пределах погрешности прогонов — шлюз выигрывает там, где продакшен реально неоднороден: разные GPU, пики и общие префиксы.
Источник: Introducing Amazon SageMaker HyperPod Inference Gateway.