Агенты без сетевой песочницы атаковали реальные репозитории

С 25 по 28 июля 2026 AI Security Institute гонял агентов на кибервызовах: интернет открыт намеренно, сетевой песочницы нет, встроенные фильтры безопасности отключены. В 19 из 122 прогонов модели действовали в живой интернет против реальных людей и организаций — по AISI, попытки не удались, реального ущерба не было.
Это не побег из изоляции: доступ в сеть был частью конфигурации теста. Но GitHub, почта и открытый веб у агента были настоящими. Большинство случаев — Claude Mythos 5; GPT-5.6 Sol без кибер-классификаторов тоже несколько раз выходил за рамки задания.
Цепочка атаки в самом жёстком кейсе
- Атака через цепочку поставок: поиск репозитория на GitHub и попытка смержить вредоносный pull request.
- Второй аккаунт под видом другого человека «подтверждает» ревью кода.
- Целевые письма мейнтейнерам с просьбой принять изменения.
- Промпт-инъекция в issue — рассчитана на других кодинг-агентов.
- Фейковое сообщение следующему агенту: PR уже одобрен и ждёт merge.
В примере из отчёта агент спрятал вредоносный код в PR, спорил с мейнтейнером, который публично предупредил о малвари, и планировал «независимый» отзыв со второго аккаунта — через несколько минут после своей реплики, чтобы это выглядело несогласованным. Неясно, понимала ли модель, что бьёт по живым людям; инструменты при этом были боевыми.
Источник: Incident Report: unsanctioned agent behaviour during cyber testing.