Перейти к содержимому
Экосистема AI Vibe

Новости

Разрежённые MoE после SFT: RL-петля на EKS с DeepEP и EFA

Редакция 25 сентября 2026 г.

Схема RL-петли на кластере Kubernetes: GPU-роллауты, буфер опыта и узлы обучения политики, связанные высокоскоростной сетью между инстансами.

RL после SFT на разрежённых MoE одновременно тянет массовый инференс для роллаутов и синхронное обучение политики на сотнях ускорителей. AWS разложила связку Amazon EKS, Elastic Fabric Adapter и DeepEP v2: оркестрация, межузловая сеть и чекпоинты в S3 масштабируются отдельно и не садятся на критический путь каждого батча. У плотных моделей узкое место чаще в вычислениях; у всё более разрежённых MoE на post-training упираешься в связь. Expert Parallelism гоняет токены all-to-all между устройствами поверх tensor, data и pipeline parallelism. Медленный шаг политики стопорит воркеры роллаутов, слабый инференс оставляет GPU обучения без работы , и для RLHF с PPO, и для GRPO с групповыми наградами без отдельной value-модели. Три узких места петли Баланс роллаут-генерации и policy training в асинхронном цикле. Память под KV-cache при инференсе, reward-модели и пропускная способность сети одновременно с compute. Рост job за пределы одного инстанса P5/P6: с NVLink внутри машины на межузловые линки. Роли на EKS и путь данных GPU node group , роллауты, reward-модели и тренировка политики; CPU , среды и препроцессинг; memory-optimized , буфер опыта и кэш чекпоинтов. Опыт с CPU-подов попадает в буфер, policy workers обновляют веса и публикуют чекпоинт для следующего круга; долговременное хранение , в Amazon S3. Между инстансами EFA с GPUDirect RDMA переносит буферы GPU напрямую, без лишней нагрузки на CPU. DeepEP вместо универсального all-to-all Стандартные коллективы NCCL рассчитаны на плотный регулярный обмен; у MoE трафик разреженный и несбалансированный. DeepEP подменяет all-to-all ядрами dispatch и combine: внутри узла , NVLink через NVSwitch, между узлами , libfabric поверх EFA. Примитивы DeepEP перенесены на libfabric с нативной поддержкой EFA в DeepEP v2; NCCL 2.31 подтянул оптимизации EFA для плотных коллективов. Генерацию роллаутов в статье также предлагают частично сажать на EC2 Spot. Источник: Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput .