Перейти к содержимому
Экосистема AI Vibe

Новости

Плотный трансформер против MoE: как NVIDIA масштабирует биомодели

Редакция 24 сентября 2026 г.

Схема маршрутизации токена к нескольким экспертам MoE вместо полного прохода через плотный стек слоёв трансформера.

Чем крупнее языковые модели, тем дороже масштабировать плотный трансформер: каждый токен проходит через каждый слой, и любое усиление модели бьёт и по обучению, и по ответу на inference. Схема mixture-of-experts (MoE) держит много подсетей-экспертов, но на один токен включает лишь небольшую часть — NVIDIA разбирает такой подход к эффективному обучению MoE для biological foundation models.

На витрине у двух моделей может совпасть число параметров, а реальная нагрузка на GPU — нет: в плотной архитектуре платите полным стеком слоёв на каждый токен, в MoE — выборочной активацией экспертов при большом общем объёме весов.

Плотная схема и MoE

  • плотный трансформер — токен проходит через все слои при росте возможностей модели
  • MoE — много экспертов, на токен активируется только небольшое подмножество
  • в фокусе поста — эффективное обучение MoE для биологических базовых моделей на стороне NVIDIA

В доступной выдержке нет метрик и деталей тренировочного стека — их стоит искать в полном тексте на Developer Blog.

Источник: Efficient MoE Training for Biological Foundation Models.