Перейти к содержимому
Экосистема AI Vibe

Новости

Ответ верный, а путь — нет: трейсы Hermes через NeMo Relay

Редакция 30 сентября 2026 г.

Разработчик сравнивает траекторию AI-агента в Phoenix: вызовы инструментов, ошибки и токены рядом с проверкой задачи.

Проверка задачи зелёная, а повторный поиск после сбоя или дочитывание файла через терминал после обрезанного чтения в чате не отражаются — зато съедают токены и секунды. NeMo Relay от NVIDIA даёт harness единый слой наблюдаемости: Hermes Agent цепляет его нативно и собирает сессию, шаги модели и вызовы инструментов в иерархию scope с таймингами и родительскими связями.

Один прогон смотрят тремя представлениями. JSONL-события ATOF — разбор отдельных scope и ошибок по uuid. ATIF строит пошаговую траекторию из тех же событий. OpenTelemetry с разметкой OpenInference уходит в OTLP-бэкенды; в туториале — Arize Phoenix: длительность, токены и аргументы инструментов рядом.

Два учебных сценария

Сначала минимальный Docker без сети: Hermes через терминальный инструмент запускает Python, скрипт печатает VALUE=42, раннер сверяет строку. Setup подтягивает Python 3.11, Hermes 0.21.1 и NeMo Relay 0.8.3 в .tutorial-runtime/, системный Python не трогает. В сводке прогона — 74 события ATOF, 2 завершённых LLM-scope, 7335 токенов, 1 вызов инструмента, 0 ошибок инструментов.

Дальше travel-задача с подсказками про конференцию: read_file, web_search, web_extract, write_file, ответ COLT 2026 и отчёт с официальным источником. Те же локальные ATOF/ATIF и экспорт спанов в Phoenix по OTLP.

108 прогонов ToolPerf

Для сравнения правок harness авторы держат задачу с автопроверкой, baseline, одну изменённую ветку, общий бюджет и число повторов с включённым NeMo Relay. Перезапуск Hermes ToolPerf 6 августа 2026 года: 9 задач по 3 раза на модель и ветку — 108 прогонов с одними промптами и лимитами.

  • Claude Sonnet 4.5: 24/27 против 23/27 на baseline и fixes, ~2,9 обращений к модели и ~16 с.
  • Qwen3 Coder 30B: успех 19/27 (70%) → 22/27 (81%), при этом LLM-вызовы 3,8 → 4,9, инструменты 2,8 → 3,9, объём ответов инструментов 16 KB → 33 KB, длительность 27 с → 42 с.

Без трейсов картина — «успех вырос». ATOF по всем 108 запускам показал: лишние ходы Qwen в основном на восстановление после блокировок; на задаче case-insensitive search один пробный вывод разогнал exploratory-поиск с 3,3 до 9,3 ходов на реплику. Улучшение harness держится только если completion растёт без нежелательной платы по латентности и стоимости.

Источник: Tracing Agent Harness Behavior with NVIDIA NeMo Relay.