В AI Gateway Vercel можно выбрать скорость или цену каждого запроса

В AI Gateway от Vercel на каждый запрос можно выбрать тариф под задачу: priority — быстрее для чата и UI, flex — дешевле, если задержка не критична. На старте работает с моделями OpenAI и Gemini; параметр serviceTier одинаков для AI SDK, Chat Completions, Anthropic Messages, Responses API и OpenResponses API.
Три тарифа
- default — стандартная обработка, базовая цена
- priority — быстрее, меньше очереди, стоимость 1.8–2× от default
- flex — 0.5× цены default, но выше задержка
Тариф не указан — запрос идёт на default. Gateway применяет выбор насколько возможно: если priority недоступен, запрос откатывается на default по обычной ставке, а не падает с ошибкой. Какой тир реально сработал, видно в метаданных провайдера.
Как включить
Значение задаётся в providerOptions.gateway через поле serviceTier. Модель можно менять без перестройки опций. Если одна модель доступна через несколько провайдеров, тариф настраивается отдельно в namespace каждого.
Биллинг
Счёт привязан к фактически отработавшему тиру: priority, откатившийся на default, тарифицируется как default, не как priority. Ошибка — только при неверном значении service tier.
Источник: Service tiers now available on AI Gateway.