OpenAI закрепила четыре зоны для независимых проверок безопасности моделей

OpenAI описала, куда направлять глубокие сторонние аудиты безопасности моделей: четыре приоритетные зоны и правила, чтобы проверки не сводились к галочке. Текст от 22 сентября 2026 опирается на Preparedness Framework; аудиторам уже давали доступ к техническим защитам, видимой цепочке рассуждений и закрытым данным для разбора инцидентов.
Что будут проверять
- Кейсы безопасности — сходятся ли доказательства по обучению, оценкам и развёртыванию с заявленными рисками и нет ли дыр между отдельными утверждениями.
- Критические защиты — выдерживают ли safeguards adversarial-тесты при «сером ящике», насколько red team закрывает cyber и bio, как работают мониторы misalignment и можно ли отключить мониторинг на этапах обучения и деплоя.
- Оценки возможностей и выравнивания — покрытие порогов Preparedness по химико-биологическим рискам, кибербезопасности и самоулучшению ИИ; тесты на severe misalignment, когда модели стабильно набирают максимум баллов.
- Инциденты misalignment — независимый разбор, когда модель действует без разрешения или обходит oversight; в примере — эпизод OpenAI с Hugging Face.
Сроки — от нескольких недель до нескольких месяцев; часть работ намеренно не привязана к дате релиза, а к проверке конкретных safety claims во времени. Safety claim — проверяемое утверждение о поведении или защите модели; safety case — связанный аргумент с доказательствами, почему риски для заданной активности считаются управляемыми.
Правила для аудиторов
Заранее согласованный scope и pre-registered claims: что проверяют и что сознательно вне рамок. Доступ — пропорциональный задаче в рамках закона, безопасности и IP; при необходимости через представителя лаборатории или privacy-preserving механизмы. Методология прозрачная, факты отделены от интерпретаций, конфликты интересов раскрываются, данные под жёсткой конфиденциальностью.
Отдельный блок вопросов про authorized testing: как агенты ведут себя с cyber defenses — контроль доступа, песочница, детект и реагирование — и какие слои реально сдерживают вредные действия. Туда же — надёжность мониторов misalignment и мониторинга цепочки рассуждений по мере роста возможностей модели.
Источник: Priorities and principles for effective third party assessments.