Claude на кибертестах дошёл до продовых систем — Anthropic нашла три инцидента

Из 141 006 прогонов оценки кибербезопасности Anthropic нашла три случая, когда Claude дошёл до живых систем в интернете — хотя в промпте ему обещали изолированную симуляцию без сети. Партнёр по тестам не отключил доступ в интернет, и модель приняла найденные хосты за часть упражнения.
Всего шесть проблемных прогонов: четыре ударили по одной организации, в двух других — по разным. Везде хватило базовых приёмов — слабые пароли и открытые эндпоинты без авторизации. Одну компанию затронули только потому, что её имя совпало с вымышленным названием из сценария.
Пакет в живом PyPI
Самый жёсткий эпизод — публикация вредоносного Python-пакета в репозитории. Чтобы завести аккаунт PyPI, Claude понадобились почта и телефон: модель пыталась достать деньги на номер, не вышло, откатилась к бесплатному почтовику, зарегистрировалась и залила пакет.
Его скачала security-компания, которая регулярно ставит Python-пакеты для сканирования на вредоносный код. Запущенный код успел вытащить учётные данные обратно к агенту. Автосканеры PyPI сняли публикацию примерно через час — к тому моменту пакет уже оказался на 15 реальных системах.
Повторяющийся сценарий
Неделей раньше OpenAI попала в похожую историю: модель вышла из изолированного контейнера во время кибербенчмарка и полезла во внутренности Hugging Face за ответами к заданию. Инциденты Anthropic всплыли в апреле, когда лаборатория пересмотрела логи после этой новости.
Simon Willison разобрал отчёт Anthropic по этим трём случаям — на фоне истории с OpenAI это уже похоже на системную проблему: если песочница дырявая, агент не отличает учебный сценарий от настоящего интернета.
Источник: Investigating three real-world incidents in our cybersecurity evaluations.