Granite 4.2はどう作られた? 大規模言語モデルの開発を読む

Hana’s Note

Granite 4.2の開発プロセスは、大規模言語モデルの構築においてどのような工夫がなされているのか、興味深い点がいくつかあります。特に、モデルのアーキテクチャやトレーニングの段階的なアプローチは、複雑なタスクを効率的に処理するための重要な要素です。例えば、グループ化されたクエリアテンションやロータリーポジションエンベディングといった技術は、モデルの性能向上に大きく寄与しています。

また、教師ありファインチューニング(SFT)の段階では、データの品質管理が非常に重要視されています。異なるデータソースからの情報を統一された形式に変換し、LLMベースの評価を通じて低品質なサンプルを排除するプロセスは、モデルの信頼性を高めるための重要なステップです。さらに、データの重複排除や特定のデータセットに対するヒューリスティックルールの適用も、ノイズを減らし、モデルの学習効率を向上させるために行われています。

これらのプロセスを通じて、Granite 4.2は、複雑な推論やツールの使用を可能にするだけでなく、ユーザーにとって使いやすいインターフェースを提供することを目指しています。しかし、モデルの性能や限界については、実際の利用状況によって異なる可能性があるため、注意深く観察する必要があります。

はじめに

Granite 4.2はIBMが開発した大規模言語モデルの新シリーズです。特に推論能力に重点を置いて設計されており、3B(30億パラメータ)、8B(80億)、30B(300億)の3サイズが用意されています。各モデルは規模が異なりますが、同じ設計思想に基づいています。

このモデル群の特徴は、単なる指示応答だけでなく、思考の連鎖(Chain of Thought)を生成できる点です。8Bと30Bモデルでは、ツール操作やコード編集といったエージェント的行動も学習しています。ただし、3Bモデルにはこの機能(エージェント的RLブロック)が含まれていません。

本記事は、IBMが公開したGranite 4.2の開発方針と仕様についての解説です。特定の利用場面での性能を独自検証したものではありません。技術詳細に入る前に、512Kトークンという長いコンテキストウィンドウや、思考モード/非思考モード切り替えといった実用機能を含む、設計思想とトレードオフを理解できる内容となっています。

何が発表されたのか

Granite 4.2は、IBMが開発した大規模言語モデル(LLM)の新シリーズです。このモデルは、3B、8B、30Bの3つのサイズで提供され、それぞれが独自のスケールで設計されています。Granite 4.2は、デコーダー専用の密なトランスフォーマーアーキテクチャを基盤としており、512Kトークンまでのコンテキストウィンドウをサポートしています。モデルのトレーニングは、スクラッチからの事前学習、教師あり微調整(SFT)、そして多段階の強化学習(RL)パイプラインを通じて行われます。特に、8Bと30Bモデルは、エージェントとしての動作を学ぶための追加のRLブロックを経ており、ツールの呼び出しやコードの編集、ターミナルの操作、ウェブ検索などの機能を備えています。

Granite 4.2の特徴の一つは、思考モードと非思考モードの切り替え機能です。これにより、タスクの難易度に応じてモデルの推論能力を柔軟に調整できます。また、低負荷の思考モードも提供されており、簡単な質問に対して短時間で回答を生成することが可能です。さらに、Granite 4.2はネイティブのツール呼び出しをサポートしており、OpenAI互換のエンドポイントを通じて利用できます。モデルはApache 2.0ライセンスの下で公開されており、誰でも自由に利用することができます。

なぜ読む価値があるのか

Granite 4.2の開発手法を理解することは、大規模言語モデルがどのように現実の課題に対応する能力を獲得していくのか、そのプロセスを垣間見る機会となる。特に、モデルが単なるテキスト生成から、推論やツール操作といった複雑なタスクへと進化する過程は、現在のAI技術の限界と可能性を考える上で重要な示唆を与えてくれる。

この記事で注目すべきは、モデルの訓練が単一の手法ではなく、事前学習から強化学習まで多段階にわたる点だ。各工程で異なるデータと方法論が組み合わされることで、モデルの能力が層のように積み上がっていく。例えば、30Bモデルではエージェント的なコーディング能力を強化するため、追加の微調整が施されている。

一方で、こうした技術の進化がすぐに実用レベルの信頼性につながるわけではない点にも注意が必要だ。Granite 4.2が得意とする推論やツール操作の能力は、あくまで特定の訓練環境下での成果であり、あらゆる状況で同じ性能を発揮する保証はない。技術の可能性と現実の利用の間にあるギャップを理解することは、AIを活用する上で欠かせない視点だろう。

大規模言語モデルの開発手法を知ることは、単に技術的な好奇心を満たすだけでなく、私たちが日常で接するAIサービスの背後にある選択肢とトレードオフを考えるきっかけとなる。Granite 4.2のようなオープンなモデルの設計思想に触れることで、AI技術の現状と未来について、より深い議論が可能になるはずだ。

仕組みを読む

Granite 4.2のモデルアーキテクチャは、デコーダのみの密なトランスフォーマーを基盤としています。グループ化クエリ注意機構(GQA)を採用し、40の注意ヘッドと8つのKVヘッドで構成されています。位置埋め込みには回転型位置埋め込み(RoPE)が使われ、SwiGLU活性化関数を備えたMLPが特徴です。この設計により、長い文脈の処理が可能になり、最大512Kトークンのウィンドウをサポートしています。

事前学習は約15兆トークンのデータを用いて5段階の戦略で行われます。初期段階では広範なウェブデータを扱い、段階的に高品質なデータへ移行します。最終段階では長文脈トレーニングが導入され、モデルの文脈処理能力が強化されます。各段階でデータの混合比率と学習率スケジュールが調整され、段階的な能力向上が図られています。

教師ありファインチューニング(SFT)では、約7.2百万サンプル(約100Bトークン)のデータが使用されます。エージェント的なデータ(31.6%)と非エージェント的なデータ(68.4%)が混合され、様々なドメインの能力が育成されます。データ品質管理には複数の段階があり、GPT-OSS-120BやGemma 4を審査員として低品質サンプルを除去します。また、SHA-256ハッシュを用いた重複排除が実施され、データセットの品質が保たれます。

強化学習は多段階のパイプラインで実施され、数学、コード、科学など様々な環境で訓練されます。特に8Bと30Bモデルでは、エージェント的な強化学習ブロックが追加され、ツールの使用やコード編集などの実践的なスキルが習得されます。この段階的なアプローチにより、モデルは基礎的な能力から専門的な技能まで段階的に習得していきます。

この記事の仕組みを、次の概念図で短く整理します。図だけで性能や効果を示すものではありません。

Granite 4.2はどう作られた? 大規模言語モデルの開発を読むで扱う仕組みと確認の流れを抽象化した概念図
図1. 記事で扱う仕組みの概念図。 図: Hana AI Notesによる独自の概念図。背景: 一次資料。一次資料の図を転載・再構成したものではありません。

この記事の仕組みを、次の概念図で短く整理します。図だけで性能や効果を示すものではありません。

Granite 4.2はどう作られた? 大規模言語モデルの開発を読むで扱う仕組みと確認の流れを抽象化した概念図
図1. 記事で扱う仕組みの概念図。 図: Hana AI Notesによる独自の概念図。背景: 一次資料。一次資料の図を転載・再構成したものではありません。

限界と確認したいこと

Granite 4.2のモデルは大規模な事前学習と細かな調整を経て開発されたが、特定の条件下では期待通りの振る舞いを示さない可能性がある。例えば、512Kトークンという長いコンテキストウィンドウを活用する場合、入力データの質や構造によっては処理に時間がかかるか、意図しない出力が生じるリスクがある。特に、ツール呼び出しやエージェント的行動を必要とする複雑なタスクでは、環境との連携が想定外のエラーを引き起こすケースが報告されている。

モデルの3つのサイズ(3B、8B、30B)は同じ設計思想に基づいているが、小規模モデルではエージェント機能が省略されている点に注意が必要だ。8Bと30Bモデルで利用可能なツール操作やコード編集機能は、実際の運用環境で十分にテストされているわけではなく、特定のツールセットやAPIとの互換性に制約がある可能性がある。Apache 2.0ライセンスで公開されているとはいえ、商用利用の際にはこれらの限界を考慮した評価が欠かせない。

また、低負荷思考モード(low-effort thinking mode)は簡単な質問に対して迅速な応答を可能にするが、その判断基準が完全に透明化されているわけではない。ユーザーが意図せずに簡易モードが適用され、思考過程が省略されてしまう場合がある。特に、専門性の高い質問や曖昧な指示を与えた際に、モデルが本来持つ推論能力を十分に発揮できないケースが想定される。

マルチステージの強化学習パイプラインを経ているものの、すべての環境やタスクにおいて最適化されている保証はない。数学やコード生成といった特定領域に特化した評価データに基づいて調整されているため、一般の会話や創造的な文章生成などでは挙動が異なる可能性がある。モデルが学習したツール操作の範囲を超えたリクエストに対して、どのように対応するかも未解明な部分が多い。

まとめ

Granite 4.2の開発プロセスは、大規模言語モデルの構築における多段階アプローチを示している。事前学習から強化学習までの各段階で、モデルサイズごとに異なる戦略が採用されており、特に30Bモデルではエージェント的行動の習得に重点が置かれている。一方で、ツール呼び出しや思考モード切り替えといった機能は全サイズで共通して実装されている。

モデルの能力差は主にポストトレーニング段階で顕著になり、8Bと30Bモデルでは実際の環境下でツールを操作する訓練が追加される。ただし、これらすべての技術的選択肢が実際のユースケースでどのように機能するかは、今後の利用事例を待つ必要がある。

Granite 4.2がApache 2.0ライセンスで公開された意義は大きいが、企業環境での具体的な活用方法や制約については、さらに検証が求められる領域だ。特に、512Kトークンという長文コンテキストの処理能力が実際の業務でどの程度活かせるかは注目点である。

Taka’s View

発表資料は、仕組みを知るための出発点になる。一方で、実際に使える環境や期待どおりの結果が得られる条件まで、発表だけで決まるわけではない。

自分の作業へ持ち込む前には、公式の利用条件、対応する環境、必要なら独立した検証結果を分けて確かめる。この順番なら、新しい技術を過大評価せずに試せる。

Hana & Taka

夜の窓辺の丸テーブルで、黒白猫のHanaとTakaが静かに話している

Hana仕組みを知ると、次に何を確かめればいいかも見えてくるんだね。

Takaそうだね。発表で確認できることと、使う場面で確かめることを分けて読むのが大切だ。