Перейти к содержимому
Экосистема AI Vibe

Новости

На GPU-кластере round-robin дороже модели: AWS дала умный шлюз для inference

Редакция 18 сентября 2026 г.

Запросы к LLM на Kubernetes идут через шлюз, который выбирает pod по загрузке GPU, а не по очереди round-robin.

Round-robin и least-connections на GPU-кластере не видят, чем занята реплика: переполнен ли KV-cache, стоит ли в очереди длинный контекст, загружен ли нужный LoRA-адаптер. Запросы копятся на занятых подах, при всплесках задержка до первого токена уходит за 4 секунды. AWS выпустила SageMaker HyperPod Inference Gateway — Kubernetes-аддон для EKS на HyperPod, который роутит inference по сигналам с GPU без смены model server и клиента.

В примере из блога пользователь чата ждал первый токен 4,4 с; с шлюзом — меньше 800 мс. Относительно наивной балансировки заявляют улучшение first-token latency до 82%.

Как выбирается под

Первый уровень — per-cluster gateway как managed addon amazon-sagemaker-hyperpod-inference. Стек на Gateway API Inference Extension: Envoy принимает HTTPS, Body-Based Router читает поле model в OpenAI-совместимом JSON и отправляет в нужный пул, Endpoint Picker тянет метрики Prometheus с подов и считает взвешенный score.

  • загрузка KV-cache — не слать на почти полную память;
  • глубина очереди и число активных запросов;
  • LoRA adapter residency — предпочитать под, где адаптер уже в GPU;
  • prefix cache hit rate — для мультитуровых чатов и document Q&A;
  • веса настраиваются под чат или batch.

Конфиг — custom resource InferenceGatewayConfig (версия аддона в гайде: v2.0.0-eksbuild.1). Снаружи обычный /v1/chat/completions; vLLM, SGLang и TGI не трогаете. Второй уровень — Global Inference Router для кросс-кластера и регионов, в том числе failover кластера примерно за 35 с — пока в roadmap.

Где прирост заметен

AWS гоняла модели от 8B до 235B на p5 (H100) и g5 (A10G), default-настройки шлюза без ручного тюнинга. На смешанных поколениях GPU у Llama-3.1-8B TTFT P95 и P99 около −97%, у Qwen3-32B throughput +50%. На bursty-трафике у Llama-3.1-70B TTFT P95 −94%, P99 −98%. На общих префиксах промпта у 8B TTFT P95 −26%, P99 −43%.

На однородном флоте при ровной нагрузке разница с round-robin в пределах погрешности прогонов — шлюз выигрывает там, где продакшен реально неоднороден: разные GPU, пики и общие префиксы.

Источник: Introducing Amazon SageMaker HyperPod Inference Gateway.