Перейти к содержимому
Экосистема AI Vibe

Новости

GPT-6: кэш промптов стал умнее — до 90% на повторном контексте

Редакция 23 сентября 2026 г.

Графики дашборда prompt caching: доля попаданий в кэш, динамика во времени и состав input-токенов cached и uncached.

Долгие агенты на GPT-6 шлют в API цепочку запросов с одними и теми же инструкциями, схемами инструментов и накопленным контекстом. OpenAI докрутила под это кэш промптов: в семействе GPT-6 выше доля попаданий по умолчанию, общий префикс можно переиспользовать в окне 30 минут, на закэшированные input tokens — скидка до 90%.

GitHub Copilot пишет, что за несколько месяцев на миллиардах запросов к моделям OpenAI доля prompt tokens, которые обрабатывают «с нуля», упала больше чем на 50% относительно прежнего baseline. Для агента, который крутится часами, это и скорость первого токена, и счёт за inference.

Дашборд и диагностика

Prompt Caching Dashboard показывает, какая часть входа отдаётся из кэша: hit rate во времени и график composition — cached против uncached tokens. Если после деплоя кривая просела, prompt caching diagnostics сравнивает запрос с недавним ответом и называет, что сломало reuse: модель, tools, настройки или сам input.

В примере из документации причина — tools_changed: и comparison_reusable_tokens, и cache_missed_tokens по 5629. Видно масштаб одного промаха, а не только итог в биллинге.

Настройки, если дефолта мало

  • Явные breakpoints — выбираете, какие префиксы кэшировать; в обновлённом guide — срок жизни префикса и влияние смены tools.
  • Reasoning effort на GPT-6 можно менять между ответами через configuration_update, не трогая effort на уровне запроса — тяжёлая задача и лёгкий follow-up в одной сессии без сброса кэша.
  • Стабильные tools — не выкидывайте definitions: allowed_tools ограничивает вызов, tool_choice со значением none отключает вызов без удаления схем; новые указания добавляйте developer messages в конец контекста.
  • Prewarming — общие инструкции и tool definitions можно прогреть при старте приложения, до первого вопроса пользователя.

У Strawberry Browser после дашборда и диагностики hit rate вырос на несколько процентов, расходы снизились на 20%; при неожиданных сбоях кэша ловят алерты и разбирают причину через Codex agents. Breakpoints позволяют держать стабильный хвост в кэше и форкать фоновые ветки диалога, почти не дублируя shared context.

Источник: Better prompt caching for GPT‑6.