TorchServe сняли с поддержки — Ray Serve DLC вместо самосборки GPU-стека

TorchServe официально заморожен: обновлений, багфиксов и патчей уязвимостей не будет, а совместимость с новыми PyTorch и CUDA остаётся на команде. AWS показала Ray Serve DLC , готовый Docker-образ для HTTP-сервинга моделей, где GPU-стек, фреймворк и слой ответа уже собраны вместе. Что ломается без поддержки Уязвимости могут так и не закрыться, а каждый сдвиг версии CUDA, PyTorch или serving-слоя приходится ловить вручную. В notice это прямо относят к работе, которая не добавляет ценности продукту , часы на зависимости вместо доработки модели. Что даёт Ray Serve DLC Deep Learning Containers , образы AWS с протестированной связкой компонентов. В inference-варианте внутри PyTorch, Ray Serve с FastAPI и Uvicorn, утилиты для vision и audio, FFmpeg с аппаратным ускорением NVIDIA. Патчи безопасности накатывают при сборке образа. отдельные теги для EKS, EC2 и SageMaker , один стек, разные контракты деплоя; база Amazon Linux 2023, GPU-сборка на официальном NVIDIA-образе с CUDA runtime; код serving подключают через ConfigMap без пересборки образа. Как это выглядит на примере В walkthrough AWS разворачивает vision-language модель Qwen3-VL-2B на Amazon EKS: один pod на g5.xlarge с GPU NVIDIA A10G и 24 GB VRAM, HTTP на порту 8000. Вместо torch-model-archiver, handler и config.properties , класс с @serve.deployment и .bind() ; модель грузят в float16 под лимит памяти. Инфраструктуру поднимают скриптами из репозитория к посту , кластер, GPU node group и Deployment с Ray Serve. Запрос на inference , POST с image_url и prompt в JSON; pod может стать Ready на минуту-две раньше, чем модель загрузится в GPU. Для масштаба за один узел в материале указывают KubeRay , распределённый serving и autoscaling поверх той же основы. Источник: Simplify and support your TorchServe workloads using Ray Serve Deep Learning Containers .