Перейти к содержимому
Экосистема AI Vibe

Новости

Generative recommender вместо трёх пайплайнов: HSTU на Dynamo-Triton

Редакция 1 октября 2026 г.

Поток событий пользователя превращается в токены и уходит в generative recommender на сервере NVIDIA Dynamo-Triton.

Generative recommender (GR) переносит персонализацию из трёх разрозненных стадий — поиск кандидатов, ранжирование и прогноз — в одну задачу моделирования последовательности по поведению пользователя. NVIDIA показывает на примере HSTU, как такую модель отдавать через Dynamo-Triton: взаимодействия, контекст, кандидаты и действия становятся токенами в потоке событий с высокой кардинальностью, а не отдельными входами для трёх скорингов.

Один поток вместо трёх стадий

Классическая схема дробит рекомендации на изолированные этапы retrieval, ranking и prediction. GR переформулирует задачу: лента — это последовательность, которую модель читает целиком. События не сворачиваются в пару агрегированных признаков — каждое остаётся полноценным токеном в high-cardinality event stream.

HSTU и сервинг через Dynamo-Triton

Материал на NVIDIA Developer связывает архитектуру HSTU как generative recommender со стеком Dynamo-Triton для продового сервинга: один контур sequence modeling вместо трёх независимых пайплайнов. Пошаговый деплой и настройки — в полном тексте по ссылке ниже.

Источник: Deploying an HSTU Generative Recommender with NVIDIA Dynamo-Triton.