AWS показала AEM: как найти один сломанный ход в длинном диалоге агента

На втором ходе длинного диалога агент может подставить profit вместо revenue — и дальше все шаги уже тащат чужую ошибку, хотя финал формально «не сошёлся». AWS показала Agent Evaluation Metric (AEM): метрику, которая разбирает траекторию по ходам и отделяет корень сбоя от каскада.
Цифры вместо одного «провал»
В примере с пятиходовым отчётом по продажам оценка всего диалога валит всю цепочку. AEM возвращает разбор: success_rate 0.2, first_failure_turn 2, root_cause inconsistent_parameter_values, root_cause_count 1 и cascading_count 3. Ходы 3–5 получают prior_action_failed — они наследуют сбой, а не создают новый.
Два измерения на каждый ход
Корректность — это truthfulness (значения и ответы согласованы с ожиданием) и completeness (все обязательные поля на месте). Считается отдельно для ответа пользователю и для вызова инструмента. Сравнение идёт семантически, не побайтово: «NYC» и «New York City» равны; порог по умолчанию — 0.5.
При падении хода таксономия называет причину — от inconsistent_parameter_values и missing_parameters до tool_mismatch. Итоговый AEM score — доля прошедших ходов; при просадке видно, просела truthfulness или completeness. Тот же каркас «разложить → по ходам → собрать» авторы закладывают под безопасность, удержание инструкций и глубину рассуждений.
Источник: Agent Evaluation Metric for multi-turn conversations.