Generative recommender вместо трёх пайплайнов: HSTU на Dynamo-Triton

Generative recommender (GR) переносит персонализацию из трёх разрозненных стадий — поиск кандидатов, ранжирование и прогноз — в одну задачу моделирования последовательности по поведению пользователя. NVIDIA показывает на примере HSTU, как такую модель отдавать через Dynamo-Triton: взаимодействия, контекст, кандидаты и действия становятся токенами в потоке событий с высокой кардинальностью, а не отдельными входами для трёх скорингов.
Один поток вместо трёх стадий
Классическая схема дробит рекомендации на изолированные этапы retrieval, ranking и prediction. GR переформулирует задачу: лента — это последовательность, которую модель читает целиком. События не сворачиваются в пару агрегированных признаков — каждое остаётся полноценным токеном в high-cardinality event stream.
HSTU и сервинг через Dynamo-Triton
Материал на NVIDIA Developer связывает архитектуру HSTU как generative recommender со стеком Dynamo-Triton для продового сервинга: один контур sequence modeling вместо трёх независимых пайплайнов. Пошаговый деплой и настройки — в полном тексте по ссылке ниже.
Источник: Deploying an HSTU Generative Recommender with NVIDIA Dynamo-Triton.