Перейти к содержимому
Экосистема AI Vibe

Новости

AWS показала AEM: как найти один сломанный ход в длинном диалоге агента

Редакция 10 сентября 2026 г.

Диалог агента из пяти ходов, где ошибка параметра во втором ходе каскадом ломает следующие три.

На втором ходе длинного диалога агент может подставить profit вместо revenue — и дальше все шаги уже тащат чужую ошибку, хотя финал формально «не сошёлся». AWS показала Agent Evaluation Metric (AEM): метрику, которая разбирает траекторию по ходам и отделяет корень сбоя от каскада.

Цифры вместо одного «провал»

В примере с пятиходовым отчётом по продажам оценка всего диалога валит всю цепочку. AEM возвращает разбор: success_rate 0.2, first_failure_turn 2, root_cause inconsistent_parameter_values, root_cause_count 1 и cascading_count 3. Ходы 3–5 получают prior_action_failed — они наследуют сбой, а не создают новый.

Два измерения на каждый ход

Корректность — это truthfulness (значения и ответы согласованы с ожиданием) и completeness (все обязательные поля на месте). Считается отдельно для ответа пользователю и для вызова инструмента. Сравнение идёт семантически, не побайтово: «NYC» и «New York City» равны; порог по умолчанию — 0.5.

При падении хода таксономия называет причину — от inconsistent_parameter_values и missing_parameters до tool_mismatch. Итоговый AEM score — доля прошедших ходов; при просадке видно, просела truthfulness или completeness. Тот же каркас «разложить → по ходам → собрать» авторы закладывают под безопасность, удержание инструкций и глубину рассуждений.

Источник: Agent Evaluation Metric for multi-turn conversations.