Granite 4.2 от IBM: open-weight модели с рассуждениями и агентами

IBM выпустила Granite 4.2: три open-weight модели (3B, 8B, 30B) с рассуждениями и нативными вызовами инструментов. На простых задачах модель может не разгонять полный ход мыслей, на сложных выдать chain-of-thought перед ответом. Лицензия Apache 2.0; через vLLM или SGLang эндпоинт отдаёт tool calls в привычном OpenAI-формате, агентный harness подключается без костылей.
Обучение с нуля на примерно 15 трлн токенов, контекст в финальной фазе пре-трейна до 512K. Раньше Granite были сильны в следовании инструкциям; 4.2 добавляет переключатель «думающий / не думающий» режим и промежуточный low-effort для лёгких вопросов.
Три размера: разная глубина agentic
- 3B, 8B, 30B: общий маршрут (пре-трейн → SFT → многостадийный RL)
- 8B и 30B дополнительно прошли agentic RL в песочницах: инструменты, терминал, код и веб-поиск
- 30B: вторую фазу SFT с упором на agentic coding и SWE-данные
Данные для SFT: около 7,2 млн сэмплов; агентные траектории собирали OpenHands, SWE-agent, Terminus-2 и другие harnesses. После фильтрации судьями и дедупликации модели дообучали цепочкой RL-стадий в NeMo-RL, от математики и кода до SWE и поиска для старших размеров.
Источник: Granite 4.2 LLMs: How They're Built.