GPT-5.6: как стартапы режут счёт агентов без потери качества

На Agents' Last Exam GPT-5.6 Sol с низкой глубиной рассуждений обходит GPT-5.5 на максимальной при том же harness. OpenAI собрала кейсы стартапов: гонять флагман на весь агентный цикл — переплата, если экстракцию и оркестрацию можно отдать Luna, Terra и Sol.
Какую модель куда
Luna и Terra с дополнительным вычислением на инференсе держатся рядом с GPT-5.4–5.5 по длинным контекстам и вызовам инструментов, но стоят заметно дешевле. На BrowseComp GPT-5.5 (Extra High) набрал 84,36% за $33,27, GPT-5.6 Luna (Extra High) — 84,04% за $1,33.
Hypha считает, что Luna сохраняет 98% точности экстракции GPT-5.5 при стоимости в 18 раз ниже. Hex перешёл на Sol с низкой глубиной рассуждений и в проде получил лучший результат: модель не гонится за плохими данными и тратит меньше токенов. Terra и Luna OpenAI предлагает для частых шагов и сценариев, где важна задержка.
Три примитива Responses API
Их вшили в обучение GPT-5.6 вместе с моделью:
- Сохранение рассуждений между ходами и нативное сжатие длинных сессий — контекст не пересобирается с нуля.
- Мульти-агентная оркестрация — параллельные субагенты и финальный синтез у главного.
- Вызов тулов кодом — модель пишет JavaScript, фильтрует и агрегирует вывод инструментов вне окна контекста.
На ARC-AGI-3 Sol с обычным harness дал 13,3%, с сохранёнными рассуждениями и сжатием — 38,3% при примерно в 6 раз меньшем числе output-токенов. Rogo с вызовом тулов кодом сохранил качество по рубрике и сократил input-токены на 21%.
Кэш промптов
TTL prompt cache для всего семейства GPT-5.6 — минимум 30 минут; точки разрыва кэша задаются детерминированно внутри контекста. Ploy на общем промпте в 29 000 токенов с cache breakpoints и workspace-specific ключами снизил долю некэшированного input на 28%.
Источник: The builder's guide to GPT‑5.6.