GLM-5.3-FlashとQwen3.8-Flash-Next、中国AI2社が偶然同じ設計に収束

中国のAI開発2社が独立に開発したモデルが、アテンション構成や最適化手法で驚くべき一致を見せた。

投稿者 central
GLM-5.3-FlashとQwen3.8-Flash-Nextの設計比較から見える次世代LLMの方向性。
ハイライト
  • 両モデルはリニアアテンションとスパースアテンションを3:1で構成する点で一致した。
  • コンテキスト圧縮は4倍圧縮、2048トークン制限という共通設計を採用している。
  • Muonオプティマイザーの高度な適用が両モデルで確認され、収束の一因とされる。

中国のAI開発企業2社が、ほぼ同時期にリリースしたオープンウェイトモデルが、偶然にも極めて類似したアーキテクチャ設計に収束したことが明らかになった。Z.aiが公開したマルチモーダルMoEモデル「GLM-5.3-Flash」と、AlibabaのQwenチームがリリースした「Qwen3.8-Flash-Next」は、それぞれ独立に開発されたにもかかわらず、アテンション機構の構成比、コンテキスト圧縮方法、残差ストリームの拡張、さらには最適化手法に至るまで、驚くべき一致を見せている。

この収束現象は、中国のAI業界における技術的な「共通言語」の形成を示唆すると同時に、今後の大規模言語モデル(LLM)開発の方向性に重要な示唆を与える。本稿では、両モデルの設計を詳細に比較し、その共通点と相違点、そして業界全体への影響を分析する。

2つのモデルの概要:GLM-5.3-FlashとQwen3.8-Flash-Next

GLM-5.3-Flashは、GLM-5シリーズ初のネイティブマルチモーダルモデルであり、MITライセンスでHugging Faceに公開された。パラメータ総数は320B、そのうち活性化されるパラメータは18BというMoE(Mixture of Experts)アーキテクチャを採用。Z.aiが匿名で「Ox Alpha」としてOpenRouter上でテストしたところ、その週で最も人気のあるモデルとなった。30Tトークンのマルチモーダルコーパスでトレーニングされ、最大100万トークンのコンテキストウィンドウをサポート。Z.aiは、GLM-5.2と比較して10分の1のコストでベンチマークを上回り、Claude Opus 4.8に迫るコーディング性能とエージェント性能を達成したと報告している。API価格は入力100万トークンあたり0.15ドル、出力100万トークンあたり0.50ドルに設定された。

一方、Qwen3.8-Flash-Nextは、次世代アーキテクチャファミリーの早期公開プレビュー版として位置づけられる。メインモデル125Bに加え、51Bのn-gram埋め込みテーブルを持つ点が特徴で、1トークンあたりの活性化パラメータは6B。ネイティブのコンテキスト長は262,144トークンで、YaRNを用いることで100万トークンまで拡張可能だ。Qwenチームによれば、トレーニングに必要な計算量はQwen3.7-Plusの約9分の1に抑えられている。添付されたテクニカルレポートのタイトルは「On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability」である。

収束点1:リニアアテンションが4分の3を占める構成

両モデルが示した最も顕著な収束点は、アテンション層の構成比率だ。GLM-5.3-Flashは45層のうち、34層がリニアアテンション、11層がフルアテンションという構成。Qwen3.8-Flash-Nextは48層を、3層のGated DeltaNet(GDN)と1層のQwen Sparse Attention(QSA)のブロックで構成し、比率は同じく3:1となる。

リニアアテンション層は、テキストが長くなってもKVキャッシュが肥大化しない「定常状態」のメカニズムを持つ。すべての履歴を固定サイズのリカレント状態に圧縮するため、トークンあたりの計算量は一定に保たれる。GLMが採用する「Kimi Delta Attention(KDA)」は、チャネル単位の細かな減衰ゲートを適用する設計。一方、QwenのGDNはヘッド単位でゲート制御を行う。ゲートの粒度に違いはあるものの、同じデルタルールのファミリーに属する。

残り4分の1の層が、正確な長距離検索を担当する。GLMはNoPE(位置エンコーディングなし)のマルチヘッド潜在アテンション(MLA)をDeepSeekスタイルで実装。Qwenはグループ化クエリアテンションをQSA内部に持つ。ここで初めてKVキャッシュが実際に使用され、次の重要な共通点へとつながる。

収束点2:4倍に圧縮、スコアリング、2048トークンに制限

両モデルとも、フルアテンション層がコンテキスト全体にアテンドすることを許さない。代わりに、小型の学習済みインデクサーが履歴をスコアリングし、勝者だけを保持する。そのパラメータはほぼ完全に一致する。

GLMのスパース層は、DeepSeekのDSAを起源とする32ヘッドの高速インデクサーを採用し、上位2048トークンを選択する。100万トークンのコンテキストにおけるインデクサーコストを削減するため、Z.aiは「IndexPool」を導入。これは、4つのインデクサーキーベクトルを重み付きプーリングで1つに圧縮する手法だ。QwenのQSAは、マイクロブロック単位で動作する。圧縮された軽量インデクサーが4トークンのブロックをスコアリングし、上位512ブロック(=2048トークン)を保持する。つまり、両モデルともスコアリング前にコンテキストを4倍に圧縮し、アテンション予算を2048トークンに制限している。QwenはQSAにより、100万トークンのコンテキストにおいて、フルアテンションと比較してプリフィルで最大7.6倍、デコードで最大4.9倍の高速化を実現したと報告している。

GLM側でもその効果は顕著だ。Z.aiによれば、フルモデルのGLM-5.3と比較して、Flashアーキテクチャはアテンション計算を約3分の1、KVキャッシュサイズを4.4分の1に削減。活性化パラメータ(18B対32B)と層数(45対92)もほぼ半減している。

収束点3:単一から4並列の残差ストリームへ

両モデルは、2017年のTransformer登場以来続いてきた単一の残差ストリームを放棄し、4つの並列ブランチに拡張。各ブロックが読み取りと書き込みを行う際、ゲートが制御を担う。GLMはDeepSeek由来の「Manifold-Constrained Hyper-Connections(mHC)」を採用し、出荷されたウェイトでは4ブランチで構成。Qwenは独自の「Gated Residual」を開発し、要素ごとのデータ依存型読み取りゲートと、ブランチごとのスカラー書き込みゲートを通じて、4つの拡張ストリームのフローを調整する。Qwenチームによれば、Gated ResidualはHyper-Connectionsが使用するブランド混合ステップを排除し、メモリアクセスのオーバーヘッドを削減。さらに、ゲートが活性化外れ値を抑制するため、FP8での残差ストレージが可能になったという。注目すべきは、Qwenチームが両アプローチをアブレーションした結果、品質はほぼ同等だったと報告している点だ。2つのラボ、2つの実装でありながら、「4つのゲート付きストリームが単一のストリームより優れる」という同一の結論に達した。

収束点4:Muon最適化とパラメータ行列の分割処理

両モデルは、トレーニングにMuonオプティマイザーを採用。さらに、同じ高度な調整を適用している。融合射影行列を、Muonによる直交化の前に、独立した変換に分割する処理だ。Qwenは、融合されたQKV、SwiGLU、GDN投影を分割し、Muonを真の2次元線形マップに適用。一方、埋め込み、ルーター、低ランクパラメータにはAdamWを使用する。Qwenはまた、新しいアーキテクチャ向けにスケーリング則を再調整し、バッチサイズのウォームアップを完全に廃止。測定の結果、ウォームアップは結果を改善することなく、オプティマイザーのステップ数を18.8%増加させることが判明したためだ。

唯一の相違点:位置エンコーディングを巡る選択

明確に分かれた唯一の設計上の選択肢が、フルアテンション層における位置エンコーディングである。GLM-5.3-Flashはこれを完全に排除した。設定でqk_rope_head_dim = 0codecodeとすることで、スパースMLA層を完全なNoPEとし、位置情報はリカレントなリニアアテンション層を通じて暗黙的に流れる。

Qwenも同様の実験を行ったが、結果としてRoPEを維持する道を選んだ。Qwen3.8-Nextのテクニカルレポートによれば、NoPEは事前トレーニング中に測定可能な差を生まなかった。問題が表面化したのはその後のプロセスだ。ポストトレーニング後、NoPEバリアントは生成を停止できないという障害を頻発させた。この結果は、事前トレーニングの損失曲線だけでは、RLHF段階のチューニングでのみ現れる行動上の欠陥を隠蔽してしまう可能性があることを示す、重要な警告となっている。

業界全体への収束と、ただ一人の異議申し立て

この設計レシピは、2社だけの現象ではない。DeepSeekは、DeepSeek-V3.2-Expでスパースインデクサーと2048トークン予算のパターンを開拓し、mHCは現在GLMに搭載されているDeepSeekの設計だ。MoonshotのKimiは、GLMが採用したリニアアテンション層KDAを提供した。中国のオープンモデルは、アーキテクチャコンポーネントを相互に受粉させ、共通の設定に収束していることが視覚的に明らかである。

注目すべき異議申し立てを行うのは、MiniMaxだ。M2の開発中、同社はリニアアテンションとスライディングウィンドウアテンションを大規模にテストし、特にSFT後の32Kコンテキストを超える領域で、マルチホップ推論に深刻な欠陥があることを発見した。M2はすべての層でフルソフトマックスアテンションを採用して出荷された。M3では、MiniMaxは「MSA(MiniMax Sparse Attention)」を採用。これはブロック選択によってソフトマックスアテンションをスパース化するものだが、リニアアテンション層を一切含まない。つまり、業界の意見は完全に一致しているわけではない。Z.ai、Qwen、DeepSeek、Kimiは、3:1のリニアハイブリッドが推論能力を維持すると考えているが、MiniMaxのアブレーション実験は、少なくとも同社のスタックにおいてはそうではないと主張している。

見えてきた次世代LLMアーキテクチャの羅針盤

GLM-5.3-FlashとQwen3.8-Flash-Nextの偶然の収束は、単なる技術的な偶然ではなく、大規模言語モデルの開発において、効率性と性能のバランスを取るための「解」が、特定の方向に収束しつつあることを示している。リニアアテンションとスパースアテンションの3:1構成、4倍圧縮と2048トークンへの制限、4分岐の残差ストリーム、Muonオプティマイザーの高度な適用——これらの設計原則は、今後登場する多くのモデルに影響を与えるだろう。

しかし、MiniMaxの異議が示すように、リニアアテンションが推論能力に与える影響については、まだ議論の余地が残されている。NoPEを巡る判断の分かれも、事前トレーニングだけでは測れない複雑な問題を浮き彫りにした。中国AI業界全体で進む技術の収束と、そこからこぼれ落ちる例外——このダイナミクスが、来たるべきLLMアーキテクチャの標準を形作っていくことになるだろう。

この記事をシェア