Обновлено 21 июля 2026
JetBrains запустила Kotlin Benchmark: 105 задач для проверки агентов

В Kotlin появился открытый эталон для AI-кодинг-агентов: JetBrains запустила Kotlin Benchmark на 105 инженерных задач из активных open-source репозиториев. Агент читает issue, разбирается в коде проекта и должен выдать патч, который проходит проверку тестами в контейнере. Датасет с тестовым каркасом выложен на GitHub, первые прогоны — на лидерборде kotlinlang.org/benchmark.
Не синтаксис, а полный цикл
Первая версия опирается на методологию SWE-bench и смотрит на уровень репозитория — от тикета до рабочего решения. Kotlin_HumanEval и Kotlin_QA проверяют синтаксис и базовые концепции языка; здесь инженерная задача в существующем проекте. Инфраструктура построена на открытом Multi-SWE-bench.
Первые цифры
Claude Code с Opus 4.7 xhigh закрыл 90 из 105 задач — 85,71% решённых. JetBrains Junie с Opus 4.7 max и Codex с GPT 5.5 xhigh набрали по 81,9%. Это первая публичная итерация без самых свежих моделей; таблица будет обновляться по мере новых прогонов.
Куда развивают эталон
- Шире покрытие экосистемы Kotlin — Android, Kotlin Multiplatform, разная сложность задач
- Больше метрик помимо прохождения тестов: стоимость, производительность, поддерживаемость и качество кода
- Больше агентов и конфигураций моделей, включая open-weight
Источник: Introducing the Kotlin Benchmark for AI Coding Agents.