IBM Granite 4.2、推論・エージェントRL搭載のオープンモデルとして公開

IBMが公開したGranite 4.2は、思考モード切替とエージェントRLを搭載したオープン推論モデルです。

投稿者 central
Granite 4.2は3B/8B/30Bの3サイズでApache 2.0ライセンス提供。
ハイライト
  • Granite 4.2は思考モードと非思考モードを切り替え可能で、低負荷モードも備える。
  • 8Bと30Bモデルにはコード編集やターミナル操作を学習するエージェントRLが組み込まれている。
  • 事前学習は約15兆トークンをスクラッチから処理し、512Kトークンまでの長コンテキスト対応。

IBMは、オープンな推論型言語モデルファミリー「Granite 4.2」を公開した。パラメータサイズは3B、8B、30Bの3種類で、いずれもApache 2.0ライセンスの下で提供される。これまでのGraniteシリーズが指示追従型アシスタントとして設計されていたのに対し、Granite 4.2は明確な推論を中核に据えた設計を採用している。すべてのモデルが回答に先立つ思考連鎖(チェーン・オブ・ソート)を出力可能で、思考・非思考の切り替えに加え、簡単な質問に対しては短い推論予算で応答する低負荷モードも備える。さらに、8Bと30Bモデルでは、コード編集、ターミナル操作、Web検索を実際のサンドボックス環境で実行するエージェント型強化学習(RL)が訓練に組み込まれている点が最大の特徴だ。IBMは同時に、LLMバックボーンを持たない470Mパラメータの音声モデル「Granite Speech 5.0 Turbo CTC」もリリースしている。

推論モードを自在に操る3つのモードスイッチ

Granite 4.2は、デコーダーオンリーの高密度トランスフォーマーであり、MoEやハイブリッド構成は採用していない。アーキテクチャ面では、8つのKVヘッドを持つグループドクエリーアテンション、10,000,000のθ値を持つRoPE、SwiGLU MLP、RMSNorm(ε=1e-5)、非結合の入出力埋め込み、bfloat16精度を採用。3Bは40層で埋め込みサイズ2560、8Bは40層で4096、30Bは64層でMLP隠れサイズ32,768を備える。公開されたアーキテクチャ表には131,072トークン(128K)のシーケンス長が記載されているが、5段階の事前学習プロセスには512Kトークンまで拡張する長コンテキストフェーズが含まれる。事前学習は約15兆トークンをスクラッチから処理している。

このモデルの最大の革新点は、チャットテンプレートを通じて公開された思考モードの切り替え機能だ。具体的には、enable_thinkingとlow_effortという2つのフラグが提供される。思考モードでは、モデルは回答の前に内部的な推論プロセスを経由し、その過程を<think>タグで囲んで出力する。低負荷モードでは、簡単な質問に対して推論トークン数を制限し、迅速な応答を実現する。非思考モードでは、推論チェーンを完全にバイパスし、従来の指示追従型モデルと同様に動作する。この設計により、ユーザーはタスクの複雑さに応じてモデルの思考深度を選択でき、計算コストと回答品質のバランスを最適化できる。

訓練パイプラインこそがGranite 4.2の核心である

Granite 4.2の真の価値は、その訓練パイプラインにある。教師ありファインチューニング(SFT)では、約720万サンプル(約100Bトークン、うち約65Bトークンが訓練可能)が使用された。その内訳は、エージェント型データが31.6%、非エージェント型データが68.4%であり、エージェント型データの69%はソフトウェアエンジニアリングタスクで占められている。軌跡データは、OpenHands、SWE-agent、Terminus-2、MiniSWE、Codex、Gooseなどのハーネスを用いて生成され、品質管理にはGPT-OSS-120BとGemma 4が判定モデルとして活用された。さらに、toolsフィールドとmessagesフィールドに対してSHA-256による重複排除も実施されている。

しかし、最も注目すべきは強化学習(RL)のチェーンである。Granite 4.2は単一のRLパスではなく、複数段階・複数環境によるRLチェーンを採用している。各段階は独立した非同期GRPO実行であり、前のチェックポイントからウォームスタートする。この際、価値ネットワークの代わりにリーブワンアウトベースラインを使用し、切り詰められた重要度サンプリングで方策外のドリフトを抑制している。RLの順序は、RLVR → スキルブースター → SWE → ターミナル → 検索 → RLHFとなっている。

このチェーンの中で、エージェント型RLブロックは8Bと30Bモデルにのみ適用される。3Bは基礎RLとアラインメントのみであり、この設計上の選択がサイズ間の能力差のほとんどを説明している。訓練は、NeMo-RLおよびNeMo-Gymを使用し、CoreWeaveがホストするNVIDIA GB200 NVL72クラスター上で実行された。IBMのCodeAlchemyパイプラインによる1兆トークンの合成コード生成と、より高速なサービングのための投機的デコード層も、この訓練パイプラインを支える重要な要素である。

エージェントRLの実際:コード編集、ターミナル、Web検索

エージェント型RLブロックでは、モデルが現実的なタスクを実行しながら学習する。SWE(ソフトウェアエンジニアリング)フェーズでは、モデルが実際のリポジトリ内でコードを読み取り、編集し、隠されたテストが通過するかどうかを報酬として学習する。ターミナルフェーズでは、Terminus-2を通じてライブシェル環境で複数ターンのエージェントループを実行する。検索フェーズでは、Web検索を伴うブラウジングループの中で質問に回答し、LLM判定器が最終回答をスコアリングする。これらのエージェント行動は、OpenAI互換のファンクションコール形式で出力されるため、特別なアダプターなしで既存のエージェントハーネスに統合できる。

RLHFフェーズでは、生成的安全性に対するアラインメントに加え、推論長に対するペナルティが適用され、冗長な思考連鎖を抑制する効果を持つ。この一連の訓練プロセスにより、Granite 4.2は単なる推論モデルではなく、実際のツールを操作するエージェントとして機能する能力を獲得している。

報告されたベンチマーク結果:3B、8B、30Bの実力

IBMが公開したベンチマーク結果を見ると、Granite 4.2の能力が明確に示されている。

ベンチマーク 3B 8B 30B
SWE-Bench Verified NA 47.67 57.00
Terminal-Bench 2.1 NA 20.56 29.24
τ³-bench 50.99 66.34 68.05
BFCL (v4) 52.41 50.29 61.39
AIME25 78.33 86.67 89.17
GPQA 54.80 64.14 66.41
MMLU-Pro 67.84 74.04 77.60
RULER 128K 55.30 71.41 81.38

特に注目すべきは、エージェント型コーディングタスクにおけるパフォーマンスだ。SWE-Bench Verifiedで30Bが57.00を記録し、Terminal-Bench 2.1でも29.24を達成している。数学推論ではAIME25で89.17(30B)と非常に高いスコアを示し、長コンテキスト処理ではRULER 128Kで81.38を記録するなど、バランスの取れた性能を確認できる。

音声モデル:LLM不要の470MパラメータGranite Speech 5.0 Turbo CTC

Granite 4.2と同時にリリースされたGranite Speech 5.0 Turbo CTCは、470Mパラメータの音声モデルであり、LLMバックボーンを一切持たない。コネクショニスト時間分類(CTC)を使用して音声をテキストにマッピングする。IBMによれば、単一のH200上で約12,600のRTFxスループットを達成し、現在のOpen ASRリーダーボードの速度リーダー(約6,000)を大きく上回る。WebGPUデモも公開されており、ブラウザ上で直接動作を確認できる。このモデルは、コールセンターや高負荷の文字起こしタスクなど、音声認識が中心となるアプリケーションに最適化されている。

デプロイ可能な環境とユースケース

すべてのGranite 4.2言語モデルはApache 2.0ライセンスで提供されるため、ダウンロード、ファインチューニング、商用利用にライセンス上の障壁はない。3BはOllamaやLM Studioを通じてノートPCで動作可能であり、Q4_K_MまでのGGUF量子化も公開されている。8Bは単一の近代的なGPUで中規模チームが利用でき、30BはA100/H100クラスの容量を持つ企業、またはvLLM上でFP8/NVFP4を使用するエンタープライズ環境をターゲットとしている。規制対象組織は、オンプレミスでウェイトを保持できるという追加の利点も得られる。

具体的な産業分野としては、ソフトウェアおよびデベロッパーツール、金融サービス、ヘルスケア、通信、公共部門、コンタクトセンターなどが挙げられる。特にコンタクトセンターでは、新しい音声モデルが活躍する場面が想定される。アプリケーション領域としては、ソフトウェアエンジニアリングエージェント、ターミナルおよびDevOps自動化、ディープリサーチおよび検索エージェント、長文書RAG、構造化ツール呼び出し、高負荷の文字起こしなど、多岐にわたる。

Granite 4.2が示すオープンLLMの新たな方向性

Granite 4.2は、オープンな推論モデルとして、思考モードの切り替え、エージェント型RLの統合、包括的な訓練パイプラインという3つの革新的要素を備えている。特に、コード編集やターミナル操作を実際に学習させるエージェントRLブロックは、従来の推論モデルとは一線を画すアプローチだ。IBMはこのモデルをHugging Faceで公開し、技術ブログやGitHubリポジトリでも詳細な情報を提供している。オープンな推論モデルの競争が激化する中で、Granite 4.2はその訓練手法とエージェント能力において、新たな基準を打ち立てる可能性を秘めている。特に日本企業においても、Apache 2.0ライセンスによる自由なカスタマイズとオンプレミス運用の可能性は、データガバナンスを重視する組織にとって大きな魅力となるだろう。今後のエンタープライズAI導入において、Granite 4.2は有力な選択肢の一つとして注目に値する。

この記事をシェア