Перейти к содержимому
Экосистема AI Vibe

Разборы

Та же модель, другой контур тестов: 13,3% → 38,3% на ARC-AGI-3 без смены весов

Редакция 9 сентября 2026 г.

Та же модель, другой контур тестов: 13,3% → 38,3% на ARC-AGI-3 без смены весов

На лидерборде агентного бенчмарка сходятся три слоя: веса модели, контур тестов и конфиг API. В посте OpenAI GPT-5.6 Sol при неизменных весах поднимает RHAE с 13,3% до 38,3% на public task set ARC-AGI-3, если сохранять рассуждения между ходами и сжимать историю вместо грубой обрезки. Для соло-разработчика с агентным циклом на OpenAI API это повод пересмотреть не модель, а то, как конвейер теряет контекст и сжигает выходные токены.

Сохранение рассуждений и сжатие контекста в Responses API

OpenAI называет две настройки, которые изменили картину на ARC-AGI-3: retained reasoning (сохранение приватных рассуждений между ходами) и compaction (сжатие истории вместо скользящей обрезки). Обе работают в Responses API; в ChatGPT и Codex они уже включены, в официальном контуре бенчмарка нет.

Параметр Официальный контур Контур OpenAI
API типовой контур ARC Responses API
Рассуждения между ходами отбрасываются после каждого действия сохраняются через previous response ID
Длинный контекст скользящая обрезка при 175 000 символов compaction (суммаризация)
Модель GPT-5.6 Sol GPT-5.6 Sol (та же)

«Benchmarks rarely measure AI models in isolation. They also measure less visible choices about API settings, harness design, and prompting.»

OpenAI рекомендует разработчикам API: Responses API, retain reasoning, use compaction: «как в ChatGPT и Codex». Точные имена полей JSON в request body в открытых постах не приведены: только концептуальное описание и ссылка на документацию Responses API.

Почему 13,3% и 38,3%: не «процент решённых задач»

ARC-AGI-3, бенчмарк агентов на незнакомых 2D puzzle-играх, где модель исследует игру и выводит правила без явных инструкций. Проценты 13,3% и 38,3%: это Relative Human Action Efficiency (RHAE), метрика сравнения с человеческим baseline, а не доля прохождений. OpenAI оценивает средний результат человека-тестировщика на том же public set примерно в 48% RHAE.

Сравнение 13,3% → 38,3% относится к public task set для GPT-5.6 Sol при неизменной модели. Отдельно OpenAI упоминает 7,8% как общий score GPT-5.6 Sol на ARC-AGI-3, другой scope; его нельзя смешивать с парой 13,3/38,3.

На примере одной игры из лидерборда: при официальном контуре ни одна топ-модель не проходит дальше первого уровня; с контуром OpenAI GPT-5.6 Sol решает все шесть уровней. OpenAI прямо пишет, что низкий score на публичном бенчмарке уже не раз становился следствием типового контура, который выбрасывал reasoning messages, а не слабости модели.

Шестикратная экономия выходных токенов в агентном цикле

При включении retained reasoning и compaction OpenAI фиксирует примерно троекратный рост score при шестикратном сокращении выходных токенов на public task set. В разборе @harrisonsec на Dev.to это сведено к выходным токенам на игру: официальный контур даёт 6× (baseline), новый контур: 1×, то есть в шесть раз меньше на игру.

Механизм простой: с сохранёнными рассуждениями модель меньше «передумывает» каждый ход, потому что не восстанавливает игру с нуля. Меньше регенерации рассуждений → меньше выходных токенов при лучшем результате. Автор Dev.to формулирует жёстче: дорогая конфигурация была дорогой потому что хуже: отброшенные рассуждения регенерировались и сжигали токены. Его оценка «72%» закрытия разрыва с human baseline, арифметика автора, не заявление OpenAI.

Для агентного конвейера на OpenAI API вывод практический: счёт в биллинге может падать не от «более умной» модели, а от контура, который перестал выбрасывать рассуждения между ходами.

Два вопроса к вашему агентному стеку

Ни Dev.to-пост, ни OpenAI не описывают конкретный IDE-стек; угол здесь через агентный цикл и конфиг API. @harrisonsec сводит проблему к поведению «почти каждого agent framework» по умолчанию: рассуждения между ходами отбрасываются, старые сообщения режутся обрезкой.

Два вопроса, которые стоит задать своему стеку:

  1. Сохраняете рассуждения между ходами? Если каждый вызов инструмента начинается с чистого листа, вы платите выходными токенами за повторное восстановление контекста, как на официальном контуре ARC-AGI-3.
  2. Сжатие или обрезка? Скользящая обрезка при переполнении контекста отбрасывает старейшие сообщения; compaction сжимает историю, сохраняя смысл длинных сессий.

«This isn't the first time we've been surprised by low scores on a public benchmark and then discovered that the eval runner was using a generic harness that dropped reasoning messages.»

Независимого воспроизведения пары 13,3/38,3% третьей стороной в доступных источниках нет. Опирайтесь на протокол OpenAI и таблицу «контур vs контур», а не на пересказ цифр лидерборда без контекста API.

Источники