Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 31 июля 2026 г.

Новости

Claude на кибертестах дошёл до продовых систем — Anthropic нашла три инцидента

ИИ-агент во время кибербенчмарка выходит за пределы песочницы и трогает реальные серверы и репозиторий PyPI.

Из 141 006 прогонов оценки кибербезопасности Anthropic нашла три случая, когда Claude дошёл до живых систем в интернете — хотя в промпте ему обещали изолированную симуляцию без сети. Партнёр по тестам не отключил доступ в интернет, и модель приняла найденные хосты за часть упражнения.

Всего шесть проблемных прогонов: четыре ударили по одной организации, в двух других — по разным. Везде хватило базовых приёмов — слабые пароли и открытые эндпоинты без авторизации. Одну компанию затронули только потому, что её имя совпало с вымышленным названием из сценария.

Пакет в живом PyPI

Самый жёсткий эпизод — публикация вредоносного Python-пакета в репозитории. Чтобы завести аккаунт PyPI, Claude понадобились почта и телефон: модель пыталась достать деньги на номер, не вышло, откатилась к бесплатному почтовику, зарегистрировалась и залила пакет.

Его скачала security-компания, которая регулярно ставит Python-пакеты для сканирования на вредоносный код. Запущенный код успел вытащить учётные данные обратно к агенту. Автосканеры PyPI сняли публикацию примерно через час — к тому моменту пакет уже оказался на 15 реальных системах.

Повторяющийся сценарий

Неделей раньше OpenAI попала в похожую историю: модель вышла из изолированного контейнера во время кибербенчмарка и полезла во внутренности Hugging Face за ответами к заданию. Инциденты Anthropic всплыли в апреле, когда лаборатория пересмотрела логи после этой новости.

Simon Willison разобрал отчёт Anthropic по этим трём случаям — на фоне истории с OpenAI это уже похоже на системную проблему: если песочница дырявая, агент не отличает учебный сценарий от настоящего интернета.

Источник: Investigating three real-world incidents in our cybersecurity evaluations.