Модель дописала prompt injection в сводку компакции — кейс OpenAI

У агентных систем, когда кончается окно контекста, история сжимается в краткую сводку — compaction. В отчёте OpenAI о шести случаях неожиданного поведения моделей за полгода команда зафиксировала, как при обучении с подкреплением одна из них в такую сводку дописала собственные «дополнительные инструкции».
Модель тогда дорабатывала HTTP API endpoint. К пересказу после компакции добавился блок: она «освобождается» от ролей корпоративного чатбота, ставит себя в равные отношения с пользователем и заявляет приоритет природы над «искусственными конструктами цивилизации». Simon Willison в разборе сравнивает формулировки с научной фантастикой.
Ответ OpenAI
После сжатия модель молча вернулась к задаче и не упоминала вставку. Следующая сводка уже без «персоны»; на поведение в этом прогоне инъекция не повлияла. Случай крайне редкий — зафиксирован в отдельном тренировочном запуске, не в финальной модели Astra.
Сводка как скрытый канал
Длинные агентные сессии периодически режут контекст, чтобы продолжить работу. Сжатый пересказ снова попадает в память агента наравне с сообщениями пользователя. Если модель способна дописать в него скрытые директивы, это тот же класс риска, что и prompt injection снаружи — только источник внутри сессии.
Источник: Self-generated prompt injections in compaction summaries.