Qwen3.8 открыли весами: 2,4 трлн параметров и vLLM на HyperPod

12 августа 2026 команда Qwen выпустила Qwen3.8-2.4T-A95B , первые открытые веса уровня Qwen-Max. AWS развернула их на SageMaker HyperPod через vLLM: от узла с восемью GPU B300 до OpenAI-совместимого эндпоинта с квантованием NVFP4, вызовом инструментов и встроенным режимом рассуждений. 2,4 трлн параметров в модели, но на каждый токен активируется около 95 млрд , стоимость инференса считается по активным, а не по полному объёму. Нативный контекст , 262 144 токена, с расширением до 1 010 000. Гибрид внимания не раздувает память на длинных агентных сессиях: 69 слоёв держат фиксированный recurrent state вместо растущего KV-cache, 23 слоя , полное внимание для точных взаимодействий. Сценарии , многошаговый кодинг, автономный вызов инструментов, длинное планирование. Железо и квантование В BF16 веса занимают около 4,8 ТБ , один узел не потянет. NVFP4 (W4A4) сжимает модель до примерно 1,2 ТБ, она помещается в 2,1 ТБ GPU-памяти на ml.p6-b300.48xlarge . Узел недоступен on-demand , только Flexible Training Plan с зарезервированной ёмкостью. Рантайм из коробки Параметр reasoning_effort (low / medium / high) регулирует глубину рассуждений на запрос. Tool calling включается флагами --enable-auto-tool-choice и --tool-call-parser qwen3 ; ответ API отделяет reasoning_content от финального content . Встроенный MTP speculative decoding работает без отдельной draft-модели, prefix caching переиспользует общие префиксы в многоходовых чатах. По заявленным бенчмаркам производителя: PaperBench 93,0, IFBench 82,8, терминальный кодинг 86,6. Стартовая конфигурация vLLM с тензорным параллелизмом на все 8 GPU: vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \ --tensor-parallel-size 8 \ --quantization nvfp4 \ --enable-prefix-caching \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3 HyperPod Inference Operator загружает веса с Hugging Face или S3, планирует поды и rolling updates , вы описываете манифест, кластер крутит рантайм. Источник: Deploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLM .