Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 28 июля 2026 г.

Новости

DeepsecBench: какие модели находят дыры в коде — и сколько это стоит

Таблица рейтинга ИИ-моделей по поиску уязвимостей в коде с метриками recall, стоимости и времени прогона.

Vercel выпустила DeepsecBench — сравнение ИИ-моделей на поиск уязвимостей в прикладном коде. Автоскан пока не закрывает задачу целиком, но в отчёте есть цена и время каждой модели — оттуда удобно собрать схему сканирования под бюджет.

В золотом наборе 231 проверенная находка по 50 точкам входа в репозитории на коммите «до фикса». Лучший прогон нашёл 30,7% из них, а 20 из 25 запусков уложились ниже 20%.

Как считают результат

Каждую модель гоняют три раза, в таблицу попадает медиана. Итоговый балл сильнее штрафует пропущенные дыры, чем ложные срабатывания — recall-weighted F2. Находки вне золотого набора проверяет отдельная модель-судья. Репозиторий, коммит и список файлов не публикуют, чтобы модели не подглядывали в патчи.

Лидерборд

  • GPT-5.6 Sol (xhigh) — 35,58 балла, 71 из 231 находок, $55,98 и 3 ч 39 мин
  • Claude Opus 5 (medium) — 28,36 балла за $31,96 и 47 минут
  • GPT-5.6 Sol (medium) — 25,10 балла за $17,95 и 30 минут: лучший баланс цены и качества
  • Kimi K3 (high) — 17,56 балла за $12,38; Grok 4.5 (high) — 15,58 за $5,60
  • Fable 5 от Anthropic в таблице нет — отказывается от security-задач, включая защитные

Цены указаны за 50 файлов. На кодовой базе порядка 5000 файлов полный проход обойдётся примерно в $1200 для Kimi K3 или свыше $5000 для топовой модели OpenAI.

Сканирование под бюджет

Инструмент deepsec гоняет те же модели через AI Gateway — один эндпоинт вместо отдельных ключей на каждого провайдера. Схема из отчёта: Grok 4.5 на каждый merge, GPT-5.6 Sol medium — на новые фичи перед пушем, frontier-модели — на редкие глубокие аудиты. Снижение reasoning у GPT-5.6 Sol с xhigh до medium убирает 3,5 часа ожидания и оставляет прогон за полчаса при заметно меньшем счёте.

Источник: DeepsecBench: evaluating model performance in finding cybersecurity vulnerabilities.