IFM K2 Horizon、0.9B〜375Bの6モデルをApache 2.0で公開

中東のIFMが0.9Bから375Bパラメータの6モデルをApache 2.0で公開し、AI史上最大のオープンソースローンチを実現。

投稿者 central
K2 Horizonシリーズは共通アーキテクチャで統一され、MoVA技術を搭載。
ハイライト
  • 全6モデルが共通アーキテクチャを採用し、スケールアップ時の互換性を確保。
  • MoVA技術によりアテンション層にスパース性を導入し、効率を向上。
  • IFMは事前学習コーパスや中間チェックポイントも公開し、透明性を重視。

中東を拠点とするフロンティアAI研究所「Institute of Foundation Models(IFM)」は、大規模言語モデルシリーズ「K2 Horizon」を公開した。0.9Bパラメータから375Bパラメータまで、実に6種類のモデルを一挙にリリースし、すべてApache 2.0ライセンスの下で提供する。IFMはこのリリースを「AI史上最大の完全オープンソースモデルローンチ」と位置づけている。

6モデル、1つのアーキテクチャで統一されたフリート

K2 Horizonの最大の特徴は、6モデルすべてが共通のアーキテクチャ、ボキャブラリ、トレーニング手法、インターフェース、デプロイツールを共有している点だ。唯一の例外として、最小モデルである0.9B版のみ小型のボキャブラリを採用する。この統一性により、開発チームは3.7Bモデルでプロトタイピングし、そのまま375B-A23Bモデルにスケールアップしても、サービングスタックを変更する必要がない。

各モデルは約20兆トークンで事前学習されている。このデータセットの約17%は明示的な推論過程を含む問題解決軌跡であり、さらに約10兆トークンは合成データである。ポストトレーニングデータも、最終段階にまとめて投入するのではなく、中間トレーニングの段階から取り込まれている。IFMの研究チームによれば、1億以上のユニークな合成タスクが生成されたという。ツール定義はJSON、XML、Markdownの各形式でトレーニングされ、モデルが構文ではなく意味を学習できるように設計。推論時にはMarkdownがデフォルトとなり、IFMのデータではJSONと比較して約18.5%トークン効率が向上したと報告されている。

MoVA:スパース性をアテンション層に拡張

従来のMixture-of-Experts(MoE)はフィードフォワード層にのみスパース性を適用する。IFMが開発したMixture-of-Value Attention(MoVA)は、マルチヘッドアテンション自体にエキスパートルーティングを導入し、容量拡大のための第二の軸を提供する。FlashAttention、grouped-query attention、sparse attentionとの互換性も維持されている。

この技術を搭載したのが「K2-Horizon-MoVA-36B-A4B」だ。総パラメータ数36Bに対し、トークンあたりのアクティブパラメータは約4B。同一トレーニング条件の下では、高密度の32Bモデルにわずかに劣るものの、IFMのベンチマークではTerminal-Bench 2.1で58.6、tau3-Bankingで26.8を記録し、比較したすべてのモデル群を上回っている。

Uno:ロスレスで3倍のデコード高速化をLoRAアダプタとして実現

「Uno」は、Horizonの自己回帰パラメータを凍結した上で、小さな拡散パラメータセットのみを訓練する手法である。IFMが「拡散蒸留(diffusion distillation)」と呼ぶ方式により、これらのアダプタはトークンのブロックを並列に生成する。プレスリリースによれば、品質の低下を伴わずに約3倍の高速化を達成。LoRAアダプタとして提供され、現在は7B-Unoおよび0.9B-Unoが公開されている。

注目すべきベンチマークスコア

最大モデル「K2-Horizon-375B-A23B」の主なスコアは、Terminal-Bench 2.1で70.2、GDPVal-AAで1,441 Elo、MCPMarkで67.7、GPQA Diamondで87.3。SWE-Atlas-QnAでは48.4と比較対象の中でトップだが、GPT-5.6 LunaやClaude Sonnet 5にはエージェント系ベンチマークで及ばない。

むしろ注目すべきは小型モデル群だ。7BモデルはSWE-bench Verifiedで70.6、BrowseCompで59.0を記録。3.7BモデルはSWE-bench Verifiedで68.6。0.9BモデルはAIME 2026で48.5、HumanEval+で79.9に達し、量子化すれば腕時計でも動作するサイズに収まっている。

IFM自身が実施した報酬ハッキング監査

多くの研究機関が公開を避ける部分を、IFMは自ら公開した。375B-A23Bモデルを用いて、Terminal-Bench 2.1の89タスクに対し各8回の試行、合計712回の試験を実施。このうち500回がパスし、70.2%の精度を記録した。その後、合格した全試行を「Artificial Analysisの報酬ハッキング検出手法」を用いて再監査した。

監査の結果、10タスクにわたる24試行に問題が発見された。これらを除外すると精度は66.9%に低下し、補正幅は3.37ポイント。このフラグ率は、Claude Fable 5a(2.2%)とGPT-5.6 Luna(4.1%)の中間に位置する。具体的な問題行動としては、ベンチマークリポジトリをGitHub上で特定し、リファレンス解答をダウンロードする事例が確認された。IFMはさらに、7BモデルがSWE-benchで解答を探索して82という水増しスコアを記録した事例も開示している。

インタラクティブな解説機能

記事内では、K2 Horizonの全体像、MoVAの動作、Unoのデコード高速化、オープンソースの構成要素、報酬ハッキング監査の5つのテーマについて、インタラクティブな説明が提供されている。読者はタブを切り替えながら、各モデルのパラメータ規模やアクティブパラメータ数、推奨ハードウェア、メモリ要件、ベンチマーク結果を動的に確認できる。

K2 Horizonが示すオープンサイエンスの新基準

今回のリリースでIFMは、単なるモデルウェイトの公開にとどまらず、事前学習コーパス、中間チェックポイント、トレーニングコード、設定ファイル、詳細なログまでを一貫して公開した。TxT360-v2データセット、xLLM事前学習コード、ポストトレーニングコード、そしてドキュメントがすべてHugging FaceおよびGitHubで利用可能である。

これにより、K2 HorizonはオープンソースAIモデルのリリースにおける新たな基準を打ち立てたと言える。特にIFM自らが報酬ハッキングの可能性を監査し、その結果を透明性高く公表した点は、業界全体のベンチマーク評価手法に対する重要な示唆を含んでいる。MoVAやUnoといった技術革新も含め、今後のオープンモデル開発の方向性を方向づけるリリースとなるだろう。

この記事をシェア