Простаивающие GPU — узкое место после гонки за моделями

Следующее узкое место в AI — не качество моделей, а загрузка GPU: Dharma-AI разбирает, почему у двух команд с похожим бюджетом экономика расходится по доле времени, когда карта реально считает. Аналогия с авиалиниями: расходы идут по календарным часам, отдача — только за часы вычислений.
Первую волну enterprise AI выигрывали на размере моделей и бенчмарках. К 2026 году даже лаборатории с безлимитным капиталом упираются в доступ к вычислениям — дефицит переехал на железо.
В 2020-м Microsoft собрала для OpenAI суперкомпьютер из более 10 000 GPU и 285 000 CPU-ядер — тогда это казалось потолком. Шесть лет спустя Anthropic тянет многогигаваттные контракты сразу на четырёх платформах — Amazon, Google, Microsoft и AMD, — а Meta подписывает сопоставимую сделку.
API или свои карты
Через API стоимость растёт линейно с числом токенов: пилот на тысячах запросов выглядит дёшево, на продакшен-объёме — уже нет. Отсюда тренд на свои GPU и локальный инференс: фиксированный капитал вместо переменного счёта. Но кластер закупают с запасом под пики — и в день запуска вопрос смещается с «где взять GPU» на «как не держать их пустыми».
Почему занятый кластер простаивает
GPU могут крутиться сутками, а спрос — нет: инфраструктуру раздувают под пик, и вне него часть мощности простаивает. Разные задачи хотят разного от железа:
- инференс в реальном времени — низкая задержка, медленный ответ считается провалом;
- батч-инференс — пропускная способность, задержку терпят часами;
- обучение и дообучение — GPU заняты днями;
- квантизация — много памяти, но ненадолго.
Планировщик, заточенный под один тип нагрузки, почти гарантированно косячит с остальными. Дашборд может показывать высокую среднюю загрузку, пока в очереди ждут задачи с другим профилем GPU. В отличие от самолёта, простаивающую карту нельзя «перебросить на другой маршрут» — только подобрать совместимую нагрузку.
Управление GPU как слой оркестрации
Ответ — не ещё одна стойка, а непрерывное управление: какая задача, когда, с каким приоритетом и на какой конкретной GPU. Это зарождающаяся дисциплина GPU Management — слой между моделями, нагрузками и железом. Решение о закупке принимают раз в квартал; решение, кому отдать освободившуюся карту под клиентский инференс или внутренний fine-tuning, — при каждом завершении задачи.
Цель уже не «занять все GPU», а выжать максимум отдачи с каждой установленной карты. Узкие специализированные модели освобождают долю кластера, который раньше целиком уходил одному generalist — но освободившуюся мощность нужно куда-то направить.
Источник: GPU Management: Why Idle GPUs Are the New Grounded Aircraft.