Перейти к содержимому
Экосистема AI Vibe

Новости

Olmo-core 3: открытый стек обучения MoE, который тянет триллион параметров

Редакция 1 октября 2026 г.

Кластер GPU маршрутизирует токены между сотнями экспертов MoE при обучении открытой модели Olmo.

Olmo-core 3 — открытый каркас Allen AI для обучения крупных mixture-of-experts с заявленным масштабом до триллиона параметров. Стек перешёл с fully sharded data parallelism на distributed data parallelism: эксперты остаются в памяти GPU, к ним едут батчи, без постоянного gather и reshard весов на каждый микробатч.

Релиз от 1 октября 2026 года — основа под следующее поколение Olmo на MoE. Раньше OlmoE шёл с 64 routed experts, Olmo 3 учили плотной архитектурой; теперь инфраструктура снова под разреженные модели. На восьми NVIDIA B300 MoE на 47 млрд параметров в предварительном тесте давал 52 000 токенов в секунду на GPU против 19 400 у прежней реализации — примерно в 2,7 раза быстрее.

Больше экспертов — почти без просадки

В одном бенчмарке пул экспертов вырос с 8 до 128 при четырёх экспертах на токен — активных параметров держали около 3,2 млрд. Суммарная ёмкость: с 4,6 до 47 млрд, throughput обучения упал менее чем на 5%. Тот же стек гоняли на конфигурациях свыше одного триллиона параметров.

Параллелизм и маршрутизация

Эксперты разнесены по GPU, слои режутся pipeline parallelism, состояние оптимизатора не копируется на каждую карту целиком. Rowwise expert parallelism, маршрутизация на GPU и grouped GEMM снижают перестановку данных и мелкие матричные умножения. На четырёх B300 MXFP8 в контролируемом бенчмарке дал около 21% выше end-to-end throughput, чем BF16, пиковая активная память — 95 GiB вместо 103 GiB; выигрыш в основном на feed-forward и обмене между экспертами.

Триллионный масштаб

На 512 GPU тестировали модель на 1,2 трлн параметров с 58,36 млрд активных на токен; пик — 858 TFLOP/s/GPU при случайной маршрутизации (замер системы, не качества обученной модели). С DeepEP v2 дошли до короткого теста на 2,38 трлн параметров. В техотчёте разбирают и ловушки вроде token gerrymandering — когда метрика баланса маршрутизации растёт, а реальная нагрузка на экспертов смещается.

Код и отчёт открыты: стек можно адаптировать под своё железо и эксперименты с routing и параллелизмом — в том же духе, что веса модели полезнее, когда открыта и инфраструктура обучения.

Источник: Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs.