DeepsecBench: какие модели находят дыры в коде — и сколько это стоит

Vercel выпустила DeepsecBench — сравнение ИИ-моделей на поиск уязвимостей в прикладном коде. Автоскан пока не закрывает задачу целиком, но в отчёте есть цена и время каждой модели — оттуда удобно собрать схему сканирования под бюджет.
В золотом наборе 231 проверенная находка по 50 точкам входа в репозитории на коммите «до фикса». Лучший прогон нашёл 30,7% из них, а 20 из 25 запусков уложились ниже 20%.
Как считают результат
Каждую модель гоняют три раза, в таблицу попадает медиана. Итоговый балл сильнее штрафует пропущенные дыры, чем ложные срабатывания — recall-weighted F2. Находки вне золотого набора проверяет отдельная модель-судья. Репозиторий, коммит и список файлов не публикуют, чтобы модели не подглядывали в патчи.
Лидерборд
- GPT-5.6 Sol (xhigh) — 35,58 балла, 71 из 231 находок, $55,98 и 3 ч 39 мин
- Claude Opus 5 (medium) — 28,36 балла за $31,96 и 47 минут
- GPT-5.6 Sol (medium) — 25,10 балла за $17,95 и 30 минут: лучший баланс цены и качества
- Kimi K3 (high) — 17,56 балла за $12,38; Grok 4.5 (high) — 15,58 за $5,60
- Fable 5 от Anthropic в таблице нет — отказывается от security-задач, включая защитные
Цены указаны за 50 файлов. На кодовой базе порядка 5000 файлов полный проход обойдётся примерно в $1200 для Kimi K3 или свыше $5000 для топовой модели OpenAI.
Сканирование под бюджет
Инструмент deepsec гоняет те же модели через AI Gateway — один эндпоинт вместо отдельных ключей на каждого провайдера. Схема из отчёта: Grok 4.5 на каждый merge, GPT-5.6 Sol medium — на новые фичи перед пушем, frontier-модели — на редкие глубокие аудиты. Снижение reasoning у GPT-5.6 Sol с xhigh до medium убирает 3,5 часа ожидания и оставляет прогон за полчаса при заметно меньшем счёте.
Источник: DeepsecBench: evaluating model performance in finding cybersecurity vulnerabilities.