Та же модель, другой контур тестов: 13,3% → 38,3% на ARC-AGI-3 без смены весов

На лидерборде агентного бенчмарка сходятся три слоя: веса модели, контур тестов и конфиг API. В посте OpenAI GPT-5.6 Sol при неизменных весах поднимает RHAE с 13,3% до 38,3% на public task set ARC-AGI-3, если сохранять рассуждения между ходами и сжимать историю вместо грубой обрезки. Для соло-разработчика с агентным циклом на OpenAI API это повод пересмотреть не модель, а то, как конвейер теряет контекст и сжигает выходные токены.
Сохранение рассуждений и сжатие контекста в Responses API
OpenAI называет две настройки, которые изменили картину на ARC-AGI-3: retained reasoning (сохранение приватных рассуждений между ходами) и compaction (сжатие истории вместо скользящей обрезки). Обе работают в Responses API; в ChatGPT и Codex они уже включены, в официальном контуре бенчмарка нет.
| Параметр | Официальный контур | Контур OpenAI |
|---|---|---|
| API | типовой контур ARC | Responses API |
| Рассуждения между ходами | отбрасываются после каждого действия | сохраняются через previous response ID |
| Длинный контекст | скользящая обрезка при 175 000 символов | compaction (суммаризация) |
| Модель | GPT-5.6 Sol | GPT-5.6 Sol (та же) |
«Benchmarks rarely measure AI models in isolation. They also measure less visible choices about API settings, harness design, and prompting.»
OpenAI рекомендует разработчикам API: Responses API, retain reasoning, use compaction: «как в ChatGPT и Codex». Точные имена полей JSON в request body в открытых постах не приведены: только концептуальное описание и ссылка на документацию Responses API.
Почему 13,3% и 38,3%: не «процент решённых задач»
ARC-AGI-3, бенчмарк агентов на незнакомых 2D puzzle-играх, где модель исследует игру и выводит правила без явных инструкций. Проценты 13,3% и 38,3%: это Relative Human Action Efficiency (RHAE), метрика сравнения с человеческим baseline, а не доля прохождений. OpenAI оценивает средний результат человека-тестировщика на том же public set примерно в 48% RHAE.
Сравнение 13,3% → 38,3% относится к public task set для GPT-5.6 Sol при неизменной модели. Отдельно OpenAI упоминает 7,8% как общий score GPT-5.6 Sol на ARC-AGI-3, другой scope; его нельзя смешивать с парой 13,3/38,3.
На примере одной игры из лидерборда: при официальном контуре ни одна топ-модель не проходит дальше первого уровня; с контуром OpenAI GPT-5.6 Sol решает все шесть уровней. OpenAI прямо пишет, что низкий score на публичном бенчмарке уже не раз становился следствием типового контура, который выбрасывал reasoning messages, а не слабости модели.
Шестикратная экономия выходных токенов в агентном цикле
При включении retained reasoning и compaction OpenAI фиксирует примерно троекратный рост score при шестикратном сокращении выходных токенов на public task set. В разборе @harrisonsec на Dev.to это сведено к выходным токенам на игру: официальный контур даёт 6× (baseline), новый контур: 1×, то есть в шесть раз меньше на игру.
Механизм простой: с сохранёнными рассуждениями модель меньше «передумывает» каждый ход, потому что не восстанавливает игру с нуля. Меньше регенерации рассуждений → меньше выходных токенов при лучшем результате. Автор Dev.to формулирует жёстче: дорогая конфигурация была дорогой потому что хуже: отброшенные рассуждения регенерировались и сжигали токены. Его оценка «72%» закрытия разрыва с human baseline, арифметика автора, не заявление OpenAI.
Для агентного конвейера на OpenAI API вывод практический: счёт в биллинге может падать не от «более умной» модели, а от контура, который перестал выбрасывать рассуждения между ходами.
Два вопроса к вашему агентному стеку
Ни Dev.to-пост, ни OpenAI не описывают конкретный IDE-стек; угол здесь через агентный цикл и конфиг API. @harrisonsec сводит проблему к поведению «почти каждого agent framework» по умолчанию: рассуждения между ходами отбрасываются, старые сообщения режутся обрезкой.
Два вопроса, которые стоит задать своему стеку:
- Сохраняете рассуждения между ходами? Если каждый вызов инструмента начинается с чистого листа, вы платите выходными токенами за повторное восстановление контекста, как на официальном контуре ARC-AGI-3.
- Сжатие или обрезка? Скользящая обрезка при переполнении контекста отбрасывает старейшие сообщения; compaction сжимает историю, сохраняя смысл длинных сессий.
«This isn't the first time we've been surprised by low scores on a public benchmark and then discovered that the eval runner was using a generic harness that dropped reasoning messages.»
Независимого воспроизведения пары 13,3/38,3% третьей стороной в доступных источниках нет. Опирайтесь на протокол OpenAI и таблицу «контур vs контур», а не на пересказ цифр лидерборда без контекста API.
Источники
- @harrisonsec — Same Model, 13.3% to 38.3% (Dev.to, 8 сентября 2026)
- OpenAI — How two settings tripled our ARC-AGI-3 scores (29 июля 2026)
- ARC Prize — задачи бенчмарка