Обновлено 21 июля 2026
Ollama на Mac: MLX быстрее на 20% и снимки состояния для кодинг-агентов

Ollama обновила MLX-движок на Apple Silicon: вывод быстрее до 20%, квантование NVFP4 точнее привычного 4-битного формата, а снимки состояния модели снимают лишнюю работу в агентских сессиях. На демо — кодинг-агент с Gemma 4 12B на MacBook Pro M5 Max, несколько субагентов и режим рассуждения.
Качество и скорость
NVFP4 точнее отслеживает динамический диапазон весов. Для Gemma 4 12B разрыв perplexity с несжатыми bf16 примерно вдвое меньше, чем у q4_K_M. Модели, заточенные под датацентр, можно импортировать и гонять локально на том же движке.
Часть операций слили в Metal-ядра через JIT-компилятор MLX, переделали GPU-сэмплинг. На промпте в 8 300 токенов NVFP4 выдаёт примерно на 20% больше токенов в секунду, чем q4_K_M — среднее за 10 прогонов.
Снимки для агентов
В агентском workflow главная нагрузка — обработка промпта. Каждый вызов инструмента шлёт заново системный промпт, описания инструментов и все прочитанные файлы. Prefix caching помогает, пока запросы идут по одной ветке — в живых сессиях этот паттерн быстро ломается.
- Несколько агентов: субагент отрабатывает задачу, основной продолжает со своего снимка — общие десятки тысяч токенов считаются один раз.
- Thinking-модели: токены рассуждения исчезают из истории, но снимок перед ответом даёт следующему ходу точку возобновления.
- Ветвления и ретраи: при расхождении с кэшем догоняется только новая ветка.
Снимки ставят в точках ветвления, через интервалы в длинных промптах и прямо перед ответом — подход тот же, что в облачных агентских нагрузках Ollama. Запуск модели: ollama run gemma4:12b-mlx; для кодинг-агента — ollama launch pi --model gemma4:12b-mlx.
Источник: Ollama's highest performance on Apple Silicon yet with MLX.