NodeWright: когда Kubernetes управляет подами, а ноды — отдельная боль

Kubernetes решает, что крутится на нодах, но не настраивает сам хост: ядро, системные пакеты, разметку дисков, security-агенты и тюнинг, от которого зависят GPU-нагрузки. NVIDIA вывела NodeWright под управление целым флотом таких машин — когда Ansible, свои скрипты и runbook'и уже не тянут рост.
Пока кластер один и регион знакомый, плейбуков и ручных процедур обычно хватает. Другой регион или новый кластер — те же шаги с нуля; апгрейд ядра может убить RDMA, критичный транспорт для многих GPU-сценариев, и разбираться приходится не в манифестах, а на уровне железа.
Что живёт на ноде помимо подов
- параметры ядра и системные пакеты
- разметка storage и агенты безопасности на хосте
- настройка хоста под GPU-нагрузки
NodeWright задуман как слой именно для этого флота нод, а не для деплоя приложений внутри кластера. Оркестратор подов и годами накопленные Ansible-процессы под GPU-кластеры остаются разными задачами — инструмент бьёт в зазор между ними.
Источник: Manage Kubernetes Node Fleets with NodeWright.