Гайд OpenAI по GPT-6: кэш, модели и длинные агентные сессии

OpenAI собрала практический гайд по семейству GPT-6: как выбрать модель под задачу, не раздувать счёт и держать агента на рельсах, когда работа тянется часами. Отдельный акцент — prompt caching: кэшированные входные токены могут стоить до 95% дешевле некэшированных, если стабильные инструкции и определения инструментов лежат в начале промпта, а меняющиеся детали — в конце.
Прод и бюджет
Перед выкладкой советуют гонять репрезентативные задачи и смотреть на успех, латентность и цену за успешный прогон. Для длинных диалогов — compaction: сжать контекст, но оставить состояние, с которого можно продолжить. Независимые шаги лучше запускать параллельно, чтобы один медленный тест не стопорил остальное; в оценке бюджета не забывать про cache writes и тарифы длинного контекста.
Три модели
- GPT-6 Astra — самый тяжёлый reasoning и computer use; для Astra есть Ultrafast — ускоряет выдачу токенов отдельно от уровня reasoning.
- GPT-6.1 Sol — сложный код, research и computer use; в Responses API — multi-agent (beta): подзадачи по разным частям репозитория уходят подагентам.
- GPT-6 Luna — повторяемые задачи с ясной целью: классификация, поля счёта, структурированные summary.
В API уровень reasoning (Low, Medium, High, Extra high / Max) можно менять mid-conversation без сброса кэша. Fast mode — когда важна стабильная латентность в чатах и coding tools; в Codex стартуют с дефолта и снижают effort на рутине.
Инструкции и длинные сессии
Eric Provencher (Developer Experience, OpenAI) отмечает: модели лучше читают неоднозначность, и сверхжёсткие рецепты в skills теперь чаще мешают. Рекомендуют короткие skills с явным «когда включать», обновить AGENTS.md — какие доки и тесты уместны, какие локальные команды разрешены без прод-доступа — и прописать границы: что агент делает сам, где обязан спросить, что входит в «готово».
На длинных прогонах в API — mid-turn steering через Responses WebSocket: правки встают в очередь и не отменяют уже запущенные тулы; асинхронные вызовы позволяют модели работать, пока снаружи идут тесты. В Codex Astra может уточнять по ходу, steering перенаправляет задачу при смене требований. Для шагов без API — computer use; в своих приложениях часто подключают Playwright для браузера и PyAutoGUI для десктопа.
Источник: A model guide for the GPT-6 family.