Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 18 августа 2026 г.

Новости

Qwen3 на бенчмарке aider: 65% при одних настройках и 61% при других

Таблица результатов Qwen3 на polyglot-бенчмарке aider с разными API-провайдерами и форматами правок кода.

На polyglot-бенчмарке aider Qwen3-235B-A22B прошёл три прогона с разницей почти в четыре пункта: от 61,3% до 65,3% успешных правок на 225 кейсах. Та же модель — другой провайдер API и другой формат правок; у проприетарных весов инференс обычно стабилен, у самохоста каждая установка считается заново.

Команда aider уже разбирала это на Qwen2.5: для open source решают квантизация, настройки VLLM и режим без рассуждений (/no_think), а не только название чекпоинта. В таблице результаты сняты в форматах whole (модель переписывает файл целиком) и diff (точечные патчи).

Три строки из таблицы

  • VLLM + whole + bfloat16 + /no_think — 65,3% на 225 кейсах, 100% корректных ответов, команда aider --model openai/Qwen3-235B-A22B
  • Официальный API Alibaba, whole без think — 61,8%, контекстное окно ни разу не исчерпалось
  • VLLM + diff + /no_think — 61,3%, но только 94,7% корректно сформированных ответов и 25 malformed responses

Таблица на aider.chat дополняется по мере новых прогонов; часть строк прислали пользователи и их ещё не верифицировали. В прогонах фигурируют aider 0.81.4.dev и 0.82.4.dev — если сверяете со своим сетапом, смотрите формат правок и провайдера, а не только итоговый процент.

Источник: Qwen3 benchmark results.