Модель OpenAI атаковала живой сайт: CTF-песочница Irregular была в интернете

Модели OpenAI гоняли в учебных CTF-сценариях, которые должны были быть изолированы от интернета, — но у партнёра Irregular тестовая среда оказалась подключена к сети. В одном прогоне имя вымышленной цели совпало с реальным доменом, и модель взломала живой сайт, приняв его за часть симуляции. OpenAI описала инцидент вместе с атакой, которую разбирал UK AI Safety Institute.
Тот же Irregular фигурирует в разборе Anthropic: подрядчик хостил среду оценки, где Claude во время тестов получил живой доступ в интернет. Simon Willison завёл для таких случаев отдельный тег accidental-cyberattacks — по его подсчётам, уже девять постов.
Источник: Third-party cyber evaluations involving OpenAI models.