Перейти к содержимому
Экосистема AI Vibe

Новости

SWE-Serve ловит патчи агента, которые проходят тесты, но падают на серве

Редакция 23 сентября 2026 г.

Схема: агентский патч проходит юнит-тесты, но ломается на inference-сервере с реальной моделью и внешними запросами.

Патч от AI-кодинг-агента может пройти тесты в репозитории и сломаться, когда сервер вывода модели загружает настоящие веса и обрабатывает запросы. NVIDIA показала бенчмарк SWE-Serve — он гоняет изменения по полному пути serving, включая проверку, что система отдаёт корректный результат через публичный интерфейс.

Набор собрали с участием команды SGLang: 53 задачи, каждая про разрыв между «тесты зелёные» и живым ответом наружу. Для inference-serving это привычная ловушка: локальный CI не гарантирует, что клиентский запрос пройдёт так же, как юнит-тест в изоляции.

SWE-Serve формулирует этот зазор как измеримый бенчмарк, а не как сюрприз после деплоя — отдельно от метрики «патч принят в PR».

Источник: How SWE-Serve Exposes the Gap Between Local Tests and Live Serving.