TensorRT Model Connect: как NVIDIA проектировала OSS под coding agents

TensorRT Model Connect — открытая коллекция референсных реализаций моделей на C++ поверх TensorRT. NVIDIA разложила, как такой репозиторий проектировать, когда coding agents — штатный способ работы, а не эксперимент с промптами: нужна архитектура под поток кандидатов от агента.
Стартовали с прозой — сделать производительность инференс-стека NVIDIA доступной разработчикам моделей без глубокой экспертизы в TensorRT. Быстро стало ясно, что узкое место не в генерации кода, а в том, как параллельные правки не ломают соседние части дерева.
Четыре принципа архитектуры
- параллельная работа — независимые потоки по длинному хвосту моделей;
- изоляция по семействам моделей;
- обратимые изменения;
- валидация с опорой на GPU.
Именно эта связка — open source, C++, TensorRT и четыре опоры — задаёт рамку для agent-native разработки: агент может наращивать кандидатов, но каталог держится на границах между семействами и проверках до merge.
Источник: AI Native by Design: Lessons Learned from Building NVIDIA TensorRT Model Connect.