Granite 4.2 от IBM: три открытые модели рассуждения, агентный RL и лицензия Apache 2.0 без ограничений

17 сентября 202612 просмотров

IBM пополнила линейку Granite тремя моделями рассуждения — на 3, 8 и 30 млрд параметров, все под Apache 2.0 и с переключателем между развёрнутым размышлением, экономным режимом и ответом без рассуждений. Версии покрупнее дополнительно прошли обучение с подкреплением в агентных песочницах, где отрабатывали правку кода, работу в терминале и веб-поиск; флагман набирает 57.00 на SWE-Bench Verified и 29.24 на Terminal-Bench 2.1.

Granite 4.2 от IBM: три открытые модели рассуждения, агентный RL и лицензия Apache 2.0 без ограничений

Три модели, одна лицензия и никаких оговорок

Granite 4.2 — это уже не ассистент, заточенный под следование инструкциям, какими были предыдущие релизы линейки. IBM перестроила семейство вокруг явного рассуждения: любая из моделей сначала проговаривает цепочку шагов, а затем формулирует ответ. В релизе три размера — 3B, 8B и 30B параметров.

Главная новость для бизнеса не в бенчмарках, а в лицензии. Все три модели распространяются под Apache 2.0: скачивание, дообучение и запуск в продакшене не требуют ни дополнительных согласований, ни ограничений на коммерческое применение. Для компаний из регулируемых отраслей возможность держать веса on-prem часто перевешивает любые строчки в таблицах с метриками.

Параллельно вышли две речевые модели Granite Speech 5.0 Turbo CTC по 470 млн параметров — о них ниже отдельно.

Режим работы переключается прямо в chat-шаблоне. Есть thinking, есть non-thinking, а между ними — low-effort: короткий бюджет рассуждения для простых вопросов, чтобы не тратить токены там, где задача этого не стоит. По сути, одна и та же модель закрывает и «подумай как следует», и «ответь быстро».

Кому какой размер

3B — ноутбук отдельного разработчика

Младшая модель рассчитана на индивидуальных разработчиков и небольшие стартапы. Запускать её можно локально через Ollama или LM Studio, в том числе на опубликованных GGUF-квантах вплоть до Q4_K_M. Это сценарий «поставил на ноутбук и экспериментируешь без счёта за API».

8B — одна современная GPU на команду

Средний размер адресован командам среднего рынка: одной актуальной видеокарты достаточно, чтобы держать модель в рабочем контуре.

30B — корпоративный контур

Старший вариант требует мощностей уровня A100 или H100, а также обслуживания в FP8 или NVFP4 на vLLM. Зато это тот случай, когда модель можно поставить внутри периметра и не отдавать данные наружу.

Отрасли, под которые IBM явно целится: разработка ПО и инструменты для разработчиков, финансовые услуги, здравоохранение, телеком, госсектор и контакт-центры — последние как раз под новые речевые модели. Типовые сценарии — агенты для написания кода, автоматизация терминала и DevOps, глубокое исследование и поиск, RAG по длинным документам, структурированный вызов инструментов и массовая транскрибация.

Архитектура: плотный трансформер без хитростей

Granite 4.2 — это decoder-only плотный трансформер. Никакой гибридности, никакого mixture-of-experts: ставка сделана на предсказуемость поведения и простоту развёртывания, что для корпоративного контура логично.

Из технических деталей:

  • Grouped Query Attention с 8 KV-головами;
  • RoPE с θ = 10 000 000;
  • SwiGLU в MLP;
  • RMSNorm с ε = 1e-5;
  • несвязанные входные и выходные эмбеддинги;
  • точность bfloat16.

Размеры различаются так: у 3B — 40 слоёв и эмбеддинги на 2560, у 8B — те же 40 слоёв, но эмбеддинги 4096, у 30B — 64 слоя и скрытый размер MLP 32 768.

В опубликованной таблице архитектуры указана длина последовательности 131 072 токена, то есть 128K. При этом предобучающий прогон состоял из пяти фаз и включал этап длинного контекста до 512K токенов. Обучение с нуля шло примерно на 15 трлн токенов.

Обучение: SFT, а затем многоэтапный RL

Этап supervised fine-tuning опирался примерно на 7,2 млн сэмплов — около 100 млрд токенов, из которых обучаемых порядка 65 млрд. Смесь данных распределена так: 31,6% агентных примеров против 68,4% неагентных, причём на программную инженерию приходится 69% агентной части.

Траектории собирали в харнессах — среди них OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex и Goose. Качество фильтровали двумя способами: в роли судей выступали GPT-OSS-120B и Gemma 4, плюс шла дедупликация по SHA-256 по полям tools и messages.

Постобучение — не один проход, а цепочка RL по нескольким средам. Каждый этап представляет собой отдельный асинхронный прогон GRPO, который warm-start'ится от чекпоинта предыдущего; вместо value-сети используется leave-one-out базовая линия, а усечённая важностная выборка ограничивает дрейф в off-policy. Порядок такой: сначала RLVR, затем skill boosters, потом SWE, Terminal и Search, и в финале RLHF.

Здесь кроется самое важное ограничение релиза: блок агентного RL применяли только к 8B и 30B. Младшая 3B проходит лишь базовый RL и выравнивание — и именно этим во многом объясняется разрыв в возможностях между размерами. Обучение велось на NeMo-RL и NeMo-Gym на кластере NVIDIA GB200 NVL72, размещённом у CoreWeave. Дополнительно в пайплайн заложили 1 трлн токенов синтетического кода из CodeAlchemy и слой спекулятивного декодирования для ускорения обслуживания.

Что показывают метрики IBM

Цифры заявлены самой IBM, поэтому их стоит читать как ориентир, а не как независимую проверку. Порядок значений — 3B / 8B / 30B:

  • SWE-Bench Verified: для 3B оценки нет, у 8B — 47.6, у 30B — 57.00;
  • Terminal-Bench 2.1: 20.56 и 29.24 соответственно;
  • τ³-bench: 50.99 / 66.34 / 68.05;
  • BFCL v4: 52.41 / 50.29 / 61.39;
  • AIME25: 78.33 / 86.67 / 89.17;
  • GPQA: 54.80 / 64.14 / 66.41;
  • MMLU-Pro: 67.84 / 74.04 / 77.60;
  • RULER 128K: 55.30 / 71.41 / 81.38.

Любопытная деталь — в тесте на вызов функций 8B слегка уступает 3B (50.29 против 52.41). Это напоминание о том, что размер сам по себе не гарантирует преимущества в каждом отдельном навыке, и выбор модели под задачу важнее, чем погоня за старшим чекпоинтом.

Речь: 470 млн параметров без LLM-бэкбона

Речевые Granite Speech 5.0 Turbo CTC устроены принципиально иначе, чем привычные ASR-системы на базе языковых моделей: здесь LLM-бэкбон не используется вовсе, а преобразование аудио в текст выполняется через connectionist temporal classification. Отсюда и компактность — 470 млн параметров.

IBM заявляет RTFx около 12 600 на одной H200, тогда как текущие лидеры скорости в Open ASR leaderboard показывают примерно 6 000. Для контакт-центров с большими объёмами записей разница в пропускной способности конвертируется в деньги напрямую. Попробовать модель можно в демонстрации на WebGPU.

Что в итоге

IBM собрала предсказуемый продукт для корпоративного рынка: плотные модели без архитектурной экзотики, открытая лицензия, развёртывание на своём железе и режимы рассуждения под разные типы задач. Агентные возможности сосредоточены в 8B и 30B, поэтому 3B логично воспринимать как недорогую точку входа и модель для простых сценариев, а не как «младшего брата» без потерь. Подробности стоит сверять по блогу IBM Research, техническому описанию и репозиторию на GitHub, ссылки на которые приводятся вместе с релизом.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Granite 4.2 от IBM — обзор трёх моделей рассуждения