Qwen3 на бенчмарке aider: 65% при одних настройках и 61% при других

На polyglot-бенчмарке aider Qwen3-235B-A22B прошёл три прогона с разницей почти в четыре пункта: от 61,3% до 65,3% успешных правок на 225 кейсах. Та же модель — другой провайдер API и другой формат правок; у проприетарных весов инференс обычно стабилен, у самохоста каждая установка считается заново.
Команда aider уже разбирала это на Qwen2.5: для open source решают квантизация, настройки VLLM и режим без рассуждений (/no_think), а не только название чекпоинта. В таблице результаты сняты в форматах whole (модель переписывает файл целиком) и diff (точечные патчи).
Три строки из таблицы
- VLLM + whole + bfloat16 + /no_think — 65,3% на 225 кейсах, 100% корректных ответов, команда
aider --model openai/Qwen3-235B-A22B - Официальный API Alibaba, whole без think — 61,8%, контекстное окно ни разу не исчерпалось
- VLLM + diff + /no_think — 61,3%, но только 94,7% корректно сформированных ответов и 25 malformed responses
Таблица на aider.chat дополняется по мере новых прогонов; часть строк прислали пользователи и их ещё не верифицировали. В прогонах фигурируют aider 0.81.4.dev и 0.82.4.dev — если сверяете со своим сетапом, смотрите формат правок и провайдера, а не только итоговый процент.
Источник: Qwen3 benchmark results.