SWE-Serve ловит патчи агента, которые проходят тесты, но падают на серве

Патч от AI-кодинг-агента может пройти тесты в репозитории и сломаться, когда сервер вывода модели загружает настоящие веса и обрабатывает запросы. NVIDIA показала бенчмарк SWE-Serve — он гоняет изменения по полному пути serving, включая проверку, что система отдаёт корректный результат через публичный интерфейс.
Набор собрали с участием команды SGLang: 53 задачи, каждая про разрыв между «тесты зелёные» и живым ответом наружу. Для inference-serving это привычная ловушка: локальный CI не гарантирует, что клиентский запрос пройдёт так же, как юнит-тест в изоляции.
SWE-Serve формулирует этот зазор как измеримый бенчмарк, а не как сюрприз после деплоя — отдельно от метрики «патч принят в PR».
Источник: How SWE-Serve Exposes the Gap Between Local Tests and Live Serving.