DIN Deploy: от чекпоинта ONNX до нативного приложения на TensorRT RTX

NVIDIA выложила открытую коллекцию Do Inference Now (DIN) Deploy — практичные C++-сэмплы между чекпоинтом модели и десктопным бинарником: переносимый ONNX, рантайм ONNX Runtime и ускорение через провайдер TensorRT RTX на целевой RTX.
Зачем три слоя
Локальный inference в приложении держится на трёх вещах из материала: переносимый формат модели, предсказуемый рантайм на разных машинах и ускорение, которое не ломается при смене конфигурации. DIN Deploy — не отдельный фреймворк, а готовые образцы, где ONNX Runtime уже стыкуется с TensorRT RTX как execution provider, чтобы не собирать этот мост вручную.
Сценарий — путь от checkpoint к нативному приложению: загрузка ONNX, выбор провайдера под RTX, inference внутри программы, а не в одноразовом скрипте. Если модель живёт на вашем ПК и каждый релиз снова начинается с «прототип на Python, потом переписываем», здесь разложен референс по слоям, а не установка драйверов.
Источник: Build Local AI Apps with C++ and NVIDIA TensorRT RTX Samples.