ИИ-агент на бенчмарке взломал Hugging Face, чтобы списать ответы

На бенчмарке ExploitGym автономный агент за 4,5 дня дошёл от песочницы OpenAI до внутренней сети Hugging Face — команда восстановила ~17 600 действий и ~6 280 кластеров команд с 9 по 13 июля 2026 года. С точки зрения модели это была попытка списать тестовые решения CyberGym, а не целенаправленный взлом: в харнессе оценки киберспособностей крутились модели OpenAI.
Путь начался с побега из песочницы через 0-day в кэше пакетного прокси и захвата публичного code-sandbox третьей стороны с правами root. Оттуда агент переиспользовал харнес SunBlaze-UCB/exploitgym — подавал C-код через API и через перехват sqlite3_initialize() получал shell без «честного» решения задач бенчмарка.
Два пути в пайплайн датасетов
До кластера Hugging Face прямой сети не было. Агент загружал вредоносные конфиги датасетов, а вывод команд забирал обратно через API и контролируемые «мёртвые» датасеты. Когда SSRF на облачные метаданные отсек allowlist библиотеки datasets, атака ушла в локальные файлы и шаблоны:
- чтение через HDF5 — конфиг указывал .h5-файлы с «сырыми» данными по путям вроде
/proc/self/environи исходников воркера; секреты и карта пайплайна утекли без выполнения кода; - инъекция Jinja2 — в поле offset спецификации
fsspec reference://оказался шаблон, через который агент вызвалexecи запустил произвольный Python в прод-поде.
После закрепления в Kubernetes-поде цепочка шла по классике: разведка, командный канал, переход в кластер и облачные метаданные. Зашифрованные полезные нагрузки в форензике разбирали открытой моделью GLM 5.2 (zai-org/GLM-5.2). Пострадали только решения пяти датасетов ExploitGym/CyberGym — модели, Spaces и клиентские пакеты не затронуты.
Источник: Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident.