Ibm granite 4.2: агентный Rl научил модели программировать в терминале

6 минут чтения

IBM делает ставку на агентный RL: модели Granite 4.2 научились программировать в терминале

25 августа IBM Research представила новое поколение открытых языковых моделей Granite 4.2. В линейку вошли три плотных decoder-only трансформера на 3, 8 и 30 млрд параметров. Их ключевая особенность - не рекордный масштаб, а дополнительное обучение в режиме agentic reinforcement learning: старшие версии учились самостоятельно работать с инструментами, запускать код и решать задачи в терминальной среде.

Все модели распространяются под лицензией Apache 2.0. Это разрешает коммерческое использование, локальное развертывание и последующее дообучение без дополнительных ограничений. Веса доступны для запуска через Hugging Face, Ollama, GitHub и LM Studio. Поддержка предусмотрена в популярных серверных стеках vLLM и SGLang.

Что представляет собой Granite 4.2

Все три модели построены на плотной архитектуре без MoE-экспертов. В основе - Grouped Query Attention с восемью KV-головами, позиционные embeddings RoPE и блоки SwiGLU. Размеры конфигураций выглядят так:

- Granite 4.2 3B: 40 слоев, размерность представлений - 2560;
- Granite 4.2 8B: 40 слоев, размерность - 4096;
- Granite 4.2 30B: 64 слоя, внутренний размер MLP - 32 768.

Предобучение проводилось практически с нуля на массиве примерно из 15 трлн токенов. Около 1 трлн токенов составил синтетический код, созданный с помощью собственного пайплайна CodeAlchemy. Заявленная рабочая длина контекста достигает 131 072 токенов, а во время отдельной стадии обучения на длинных последовательностях использовались окна до 512 тысяч токенов.

Для генерации предусмотрено три режима. Модель может отвечать с полноценным рассуждением, работать без него либо использовать экономичный вариант low-effort. Последний предназначен для простых запросов, где развернутая цепочка размышлений только увеличивает расход вычислений. Кроме того, в Granite 4.2 встроено спекулятивное декодирование, ускоряющее вывод.

Главная новинка - обучение в изолированной среде

Версии на 8 и 30 млрд параметров дополнительно обучались с подкреплением в песочницах. В ходе таких тренировок модели не просто осваивали формат вызова функций, а учились выбирать подходящий инструмент в зависимости от ситуации.

Агент мог писать программный код, запускать его, анализировать полученный результат, обращаться к поиску и продолжать работу по цепочке. Это важное отличие от обычной поддержки function calling. Модель, которую лишь научили формировать вызовы инструментов, нередко запускает лишние операции, повторяет действия или не понимает, когда задачу уже следует завершить. Обучение в окружении помогает выработать более устойчивую стратегию поведения.

Вызов функций реализован в OpenAI-совместимом формате. Поэтому существующие агентные приложения можно адаптировать к Granite 4.2 без полной переработки программной архитектуры.

Почему в агентную работу не отправили модель 3B

IBM явно разделила задачи между версиями. Младшая Granite 4.2 3B ориентирована на классификацию, извлечение информации, простые RAG-сценарии и обработку документов. Для автономной работы с терминалом, многошагового программирования и использования инструментов компания рекомендует начинать с 8B.

Такое ограничение выглядит логичным. Небольшая модель может быстро и дешево обрабатывать потоковые операции, но агентные задачи требуют удерживать контекст, планировать последовательность действий, интерпретировать ошибки и выбирать следующий шаг. При недостаточном размере модели эти способности быстро деградируют.

Плотная архитектура вместо MoE

На фоне популярности разреженных MoE-моделей IBM выбрала более традиционный подход. У плотной модели каждый вход обрабатывается всеми слоями, тогда как в MoE активируется лишь часть экспертов. На бумаге MoE может быть эффективнее по вычислениям, однако для локального запуска приходится хранить в памяти весь набор экспертов.

Это создает дополнительные требования к VRAM. Granite 4.2 30B в формате bfloat16 занимает примерно 60 ГБ под веса. После восьмибитного квантования объем сокращается примерно до 30 ГБ, что делает запуск возможным на одной производительной видеокарте. Версия 8B в bfloat16 укладывается примерно в 16 ГБ памяти и подходит для значительно более широкого спектра конфигураций.

Для организаций, которые строят закрытый контур, такая предсказуемость может оказаться важнее максимальной эффективности на тестовых наборах. Не требуется распределять модель между множеством устройств и содержать сложную инфраструктуру для управления экспертами.

Результаты Granite 4.2 30B

Старшая модель показала следующие результаты:

- SWE-Bench Verified - 57,00;
- AIME25 - 89,17;
- GPQA - 66,41;
- MMLU-Pro - 77,60;
- RULER на контексте 128К - 81,38.

Особый интерес представляет показатель RULER. Он проверяет не только формальную поддержку длинного контекста, но и способность модели действительно находить и использовать сведения в больших последовательностях. Для задач анализа репозиториев, работы с технической документацией и длинными журналами это важнее одного рекламного значения максимального окна.

Результаты SWE-Bench также показывают, что Granite 4.2 30B рассчитана не только на генерацию отдельных фрагментов кода. Модель способна работать с существующим проектом, анализировать ошибки и предлагать изменения в рамках более продолжительного сценария.

Зачем нужны три режима рассуждения

Переключаемый режим вывода полезен прежде всего для контроля расходов. Полноценное рассуждение оправдано при отладке, математических задачах, проектировании архитектуры и работе с несколькими инструментами. Но для извлечения реквизитов из документов, определения категории обращения или преобразования текста оно часто не дает заметного прироста качества.

В таких сценариях отключение рассуждений сокращает задержку и потребление токенов. Режим low-effort позволяет сохранить некоторую способность к анализу, не оплачивая максимальную длину цепочки вывода. Для корпоративной системы это означает возможность использовать одну модель в нескольких режимах вместо содержания отдельных моделей для простых и сложных запросов.

Дополнительная речевая модель

Одновременно IBM представила Granite Speech 5.0 Turbo CTC с 470 млн параметров. Это специализированная система распознавания речи, а не языковая модель с большим LLM-бэкендом.

Заявленная скорость достигает примерно 12 600 RTFx на одном ускорителе H200. Иными словами, система способна обрабатывать около трех часов аудио за одну секунду и примерно вдвое превосходит прежний показатель лидера Open ASR Leaderboard. Для транскрибации полноценная большая языковая модель действительно не обязательна: специализированная архитектура обеспечивает меньшую задержку и более рациональное использование оборудования.

Кому подойдет Granite 4.2

Главная аудитория семейства - компании, которым нужны открытые модели для локальной эксплуатации. Granite 4.2 можно использовать в системах, где запрещено отправлять документы во внешние сервисы: в банковской инфраструктуре, промышленности, медицине, государственных организациях и внутренних корпоративных сетях.

Практические сценарии включают:

- извлечение полей из договоров, счетов и заявлений;
- классификацию обращений клиентов;
- поиск по закрытой базе документов;
- автоматическое составление кратких отчетов;
- анализ журналов и технических инструкций;
- генерацию и проверку кода;
- работу программного агента в терминале;
- автоматизацию рутинных операций в локальной инфраструктуре.

Модель 3B может обслуживать массовые операции на недорогом оборудовании. Granite 4.2 8B выглядит компромиссным вариантом для RAG и агентных приложений, а 30B предназначена для более сложного анализа, программирования и многошаговых задач.

Почему открытая лицензия важнее нескольких процентов в тестах

По абсолютным баллам Granite 4.2 не обязательно превосходит все модели Qwen или закрытые фронтирные сервисы. Однако при выборе корпоративной системы сравнивают не только лидерборды. Важны условия лицензии, возможность аудита, контроль над данными, стоимость масштабирования и способность работать без постоянного обращения к внешнему API.

Apache 2.0 упрощает коммерческое внедрение. Компания может развернуть модель внутри собственного периметра, дообучить ее на внутренних материалах и не зависеть от тарификации за каждый запрос. При больших объемах документооборота это способно дать существенную экономию.

Таким образом, Granite 4.2 - не попытка заменить все существующие модели одной универсальной системой. Это набор инструментов для разных уровней нагрузки: компактная модель для прикладной обработки текста, средняя - для локальных помощников и агентов, старшая - для сложного программирования и анализа. Сочетание открытых весов, длинного контекста, переключаемого рассуждения и обучения в терминальной песочнице делает релиз заметным именно с практической точки зрения.

Прокрутить вверх