Aider убрал $6.32 с лидерборда: litellm не считал reasoning-токены

Aider снял с лидерборда $6.32 за прогон полиглот-бенчмарка на Gemini 2.5 Pro Preview 03-25 — цифра оказалась заниженной. Виноват не тариф модели, а litellm: пакет, через который Aider ходит в API, не отдавал в отчёт reasoning-токены — скрытую часть расхода на моделях с режимом размышления. Собственные тарифы в Aider были верными, но без полного счёта токенов итог всё равно уехал вниз.
Неверная запись о цене за токен в базе litellm для этой модели тоже существовала, на бенчмарк она не повлияла: Aider подгружает цены из model-metadata.json и перекрывает данные litellm. Дополнительные прогоны с коммита 0282574 это подтвердили — при заведомо завышенной цене во внутренней базе отчёт рос пропорционально.
Где ломался подсчёт
12 апреля 2025 года бенчмарк шёл на версии litellm, которая не включала reasoning-токены в счётчики. Исправление вышло 21 апреля в коммите a7db0df и релизе v1.67.1. Aider подтянул зависимость 28 апреля и выпустил v0.82.3 5 мая.
Почему точную цифру не восстановить
Preview 03-25 уже недоступен — повторный прогон невозможен. Для ориентира авторы приводят версию 05-06: тот же тест обошёлся примерно в $37. Разница с $6.32 показывает, насколько reasoning-токены могут раздуть строку «стоимость прогона» в coding-бенчмарках.
Источник: Gemini 2.5 Pro Preview 03-25 benchmark cost.