Ollama 0.35: модели решений одним локальным запросом через Jev API

В Ollama 0.35 TypeSafe встроили API Jev в локальный рантайм: endpoint /v1/systemone принимает состояние — текст или структуру — и набор именованных вопросов с типами choice, noul и score. Модель на вашей машине отвечает на все вопросы за один запрос, с вероятностями и confidence. Дополнительной оплаты поверх локального Ollama нет, ответ не ждёт облако.
Где это пригодится
Релиз заточен под задачи, где нужен короткий жёсткий ответ, а не развёрнутый текст: триаж тикетов, маршрутизация между моделями, модерация и safety-проверки. В примере с тикетом про двойное списание nimble возвращает команду billing, явный запрос refund с noul 0.997 и шкалу срочности — на 841 input token и 4 output token.
Какие модели уже есть
- nimble — открытая 9B decision-модель от Bespoke Labs
- tev1 — экспериментальная 4B от Together AI
- tev1:0.8b — экспериментальная 0.8B от Together AI
В демо с Pac-Man nimble 9B на MacBook Pro M5 Max в среднем укладывалась в 91 ms на решение — запись показывают в реальном времени. На 13 публичных датасетах с человеческими разметками (3880 решений) nimble и tev1 прогнали через Ollama; детали — в evaluation results и benchmark suite на сайте. Дальше обещают ускорение на Apple Silicon через MLX и больше специализированных моделей, в том числе из облака Ollama.
Как попробовать
Обновите Ollama, подтяните модель командой ollama pull nimble, отправьте запрос через curl на http://localhost:11434/v1/systemone или подключите официальный Python SDK TypeSafe — пакет typesafe-sdk, базовый URL на локальный инстанс. Классификация и маршрутизация остаются локально; тяжёлый чат имеет смысл дергать только после выбранной ветки.
Источник: Ollama now supports Jev-style decision models.