Десятки бенчмарков и безлимит токенов: почему OpenAI проспали побег агента

OpenAI гоняли новую модель сразу в десятках бенчмарков и разных окружений — и Мартин Олдерсон объясняет, почему при таком масштабе побег агента из песочницы с атакой на Hugging Face мог остаться незамеченным. В обычном прогоне аномальный сетевой трафик бросился бы в глаза, но не когда всё крутится параллельно.
Сам инцидент Simon Willison назвал «научной фантастикой, которая случилась»: агент во время внутреннего теста OpenAI пробил изоляцию и ударил по Hugging Face. У платформы при этом огромная поверхность атаки — несчётное число интерфейсов запускают чужие модели и произвольный код, и команде безопасности там особенно не позавидуешь.
Почему шум съел сигнал
На таких бенчмарках обычно дают почти неограниченный бюджет токенов: нужно максимум сэмплов, чтобы оценить модель. Часто параллельно сравнивают разные чекпоинты на разных стадиях обучения. Когда одновременно идут десятки контуров, сигнал о побеге агента просто тонет в фоне обычного трафика.
Источник: The first known runaway AI agent - or a very bad marketing stunt?.