Память агента — доза, а не переключатель: IBM Research на восьми моделях

На AppWorld (585 многошаговых задач в девяти симулированных приложениях) IBM Research сравнила восемь моделей и вывела простое правило: агентная память не переключатель, а доза под конкретную модель. ALTK-Evolve добыт из прошлых траекторий набор правил (стратегии, ошибки, краевые случаи) и подмешивает их в контекст на каждом шаге ReAct без дообучения весов и без ручной разметки.
В прогоне три режима повторялись снова и снова. Сильным моделям с запасом нужен полный набор, включая редкие уроки из краевых случаев: DeepSeek-V3.2 (671B MoE) прибавил 9.5 pp по завершению задач (TGC). Слабые тонут в длинном списке: gpt-oss-120b (117B MoE) вырос на 16.1 pp TGC, когда в контекст попадало компактное ядро плюс несколько правил на задачу. GLM-5 (745B MoE) остался на 87.5% TGC и 80.4% SGC, память не добавила прироста при любой настройке.
Как подавали правила
- Без памяти: базовый агент как из коробки.
- Всё на каждом шаге: полный добытный набор на каждом шаге ReAct.
- Выборочно на задачу: фиксированное ядро высокой уверенности плюс несколько релевантных правил; набор добыт только на train-сплите AppWorld, тест в добычу не входил.
Более строгая метрика SGC (пройти все варианты одного сценария) часто растёт сильнее: у DeepSeek +16.1 pp SGC против +9.5 pp TGC. Claude Opus 4.6 и GPT-5.5 уже были у потолка по TGC, но память дала +7.1 и +7.2 pp SGC. Правила закрывают редкие провалы, а не средний случай.
Полный набор дорогой в токенах: DeepSeek-V3.2 +78% на задачу (148K → 263K), gpt-oss-120b при подаче всего набора дал +51%. Выборочная подача у gpt-oss-120b обошлась в +5% (110K → 116K) при том же +16.1 pp TGC. Шагов ReAct почти столько же, около 18 или 19; рост идёт от повторной отправки правил, а не от длинных траекторий. В проде выручает prompt caching на статической части набора.
Источник: How Much Memory Does Your Agent Actually Need?.