Плотный трансформер против MoE: как NVIDIA масштабирует биомодели

Чем крупнее языковые модели, тем дороже масштабировать плотный трансформер: каждый токен проходит через каждый слой, и любое усиление модели бьёт и по обучению, и по ответу на inference. Схема mixture-of-experts (MoE) держит много подсетей-экспертов, но на один токен включает лишь небольшую часть — NVIDIA разбирает такой подход к эффективному обучению MoE для biological foundation models.
На витрине у двух моделей может совпасть число параметров, а реальная нагрузка на GPU — нет: в плотной архитектуре платите полным стеком слоёв на каждый токен, в MoE — выборочной активацией экспертов при большом общем объёме весов.
Плотная схема и MoE
- плотный трансформер — токен проходит через все слои при росте возможностей модели
- MoE — много экспертов, на токен активируется только небольшое подмножество
- в фокусе поста — эффективное обучение MoE для биологических базовых моделей на стороне NVIDIA
В доступной выдержке нет метрик и деталей тренировочного стека — их стоит искать в полном тексте на Developer Blog.
Источник: Efficient MoE Training for Biological Foundation Models.