米Meta(メタ)は2026年9月、同社の最上位AIモデル「Muse Spark 1.3」を公開した。自称「ほぼ計測するのが馬鹿らしいほど安価」なフロンティア性能を謳う一方、現在提供されているバージョンは最上位構成(max reasoning configuration)ではなく、追加の安全性テストを経た「max版」は後日提供とされている。この記事では、企業ユーザーが現時点で実際に利用できる「xhigh」構成の実力とコスト、そして競合であるGoogleやAnthropicとの比較、さらに揺れ動くMetaのオープンウェイト戦略について、詳細なベンチマークデータと業界動向を交えて分析する。
マーク・ザッカーバーグCEOはX(旧Twitter)への投稿で、Muse Spark 1.3を「コード生成とエージェントワークにおける最大の飛躍」と称し、その性能向上を強調した。確かに、前月リリースの1.2と比較して、特に長時間のエージェントタスクにおいて顕著な進歩を見せている。第三者ベンチマークでも、価格性能比に優れたモデルとしてランキング上位に食い込んでいる。
しかし、問題はその「最上位版」が現時点では提供されていない点にある。Metaが発表資料で華々しく掲げるベンチマークスコアの多くは、max reasoning構成によるものだ。同社はこのバージョンについて「追加の安全性テストを完了次第、間もなく提供する」と説明している。第三者評価機関のArtificial Analysisは、max版を限定的なパートナープレビューで評価したものの、現時点でこの構成に対応するAPIプロバイダーは存在しないとしている。
本稿では、現在API経由で広く利用可能なxhigh構成に焦点を当て、その真の実力と企業にとっての実用的価値を検証する。
「出荷版」xhighの実力は?フロンティア集団入りも首位には及ばず
Metaは評価レポートで両方の構成のスコアを開示しており、出荷可能なモデルの性能を隠しているわけではない。しかし、発表資料ではmax版のスコアが前面に押し出されている。例えば、コードエージェント評価のGDPval-AA v2ではmaxが1754 Eloに対しxhighは1709、OSWorld 2.0ではmax 66.9に対してxhigh 57.2と、明確な差がある。一方、DeepSearchQAのようなテストでは両者89.4で同点、Terminal-Bench 2.1ではxhighが89.2でmaxの88.8を上回るテストもある。
Artificial AnalysisのIntelligence Indexスコアでは、Muse Spark 1.3 maxが62、xhighが61と評価された。これはGPT-5.6 Sol max、Grok 4.6 high、Claude Opus 5 highと同水準だ。しかし、現時点のリーダーボード最上位はAnthropicが独占している。Claude Fable 5.1はmaxで66、xhighで65を記録し、Claude Opus 5もmaxとxhighで63と、Muse Spark 1.3が上回れていない領域がある。
それでも、Muse Spark 1.2が「Anthropicの最強モデルに概ね劣る」という評価だったことと比較すれば、Metaは大きな前進を遂げた。コード生成やエージェント評価の複数のテストで、OpenAIやAnthropicと互角以上の勝負を演じている。
さらに、モデルの使い勝手も改善されている。Muse Spark 1.3は、長いスレッド内で複数のワークフローを維持し、ツールを使ってコンテキストを収集し、自らの計画のギャップを検出し、必要に応じてユーザーに確認を求めるよう訓練されている。Metaの内部比較では、コード作成時に1.2と比較してツール呼び出しが約20%、トークン消費量が約25%削減されたという。エンタープライズ向けに数千万回のエージェントループを実行する場合、こうした行動の改善は、リーダーボード上の数値以上に重要となる可能性がある。
「ほぼ無料」の真実:価格は据え置き、タスクコストは増加
ザッカーバーグ氏の「almost too cheap to meter」という主張だが、MetaはAPI価格を一切引き下げていない。Standard層の価格はMuse Spark 1.2から据え置きで、入力100万トークンあたり1.25米ドル、出力100万トークンあたり4.25米ドル、キャッシュ入力トークンあたり0.15米ドルだ。
この価格帯は競合と比較しても魅力的だが、Independentなベンチマークにおける「タスク完了コスト」は世代間で増加している。Artificial Analysisの測定によれば、Muse Spark 1.3 xhighのIntelligence Indexタスクあたりのコストは0.55米ドル。これは同じ知能指数(61)のモデル群の中で最も低いコストだが、前世代のMuse Spark 1.2(指数57)の0.40米ドルと比較すると、指数あたりの効率は向上しているものの、絶対コストは上昇している。その要因は、エージェント評価における入力トークン消費量の増加にあると分析されている。
つまり、「安さ」はエージェントが稼働するワークフロー全体の文脈で捉える必要がある。トークン単価、推論の深さ、インタラクション回数、ツール呼び出し、再試行など、あらゆる要素が最終的なコストに影響を与える。
Metaはトレーニング目的でプロンプトと出力の利用を許可する代わりに、非常に安価なContributor層(入力0.10米ドル/100万トークン、出力0.20米ドル/100万トークン)も提供している。プロトタイピングには魅力的だが、プロプライエタリなコードや機密情報を扱うエンタープライズにとっては、データガバナンスの観点から別途検討が必要となる。
「Gemini who?」──GoogleとMeta、熾烈なエージェント競争
MetaのチーフAI責任者であるアレクサンダー・ワン氏は、Artificial Analysisの結果を受けて「Gemini who? 😱💨」とXに投稿し、同日にリリースされたGoogleの新しいFlashモデル「Gemini 3.8 Flash」を挑発した。同モデルは、長時間のソフトウェアエンジニアリングや自律エージェントといった、Muse Spark 1.3とまったく同じワークロードをターゲットにしている。
互いのスペックを比較すると、まさに接戦である。
- 知能指数:Muse Spark 1.3 xhighは61、Gemini 3.8 Flash high reasoningは59。
- タスクコスト:Muse Sparkが0.55米ドル、Geminiが0.58米ドル。
- 出力スループット:Geminiが約305トークン/秒、Muse Sparkが約235トークン/秒(Geminiが約30%高速)。
- API価格(プロモーション価格):Geminiは入力0.75米ドル/出力3.75米ドル、Muse Sparkは1.25米ドル/4.25米ドル。
ただし、Geminiのプロモーション価格は2026年12月31日までで、その後は入力1.50米ドル/出力7.50米ドルに値上がりする。ワン氏の挑発的な発言はさておき、企業のアーキテクトにとっては、「Geminiはより高速で、Museは現時点ではやや高い推論能力を持つ」という、機能性とコストのトレードオフを天秤にかける必要があることを示している。
揺れ動く「オープンウェイト」戦略:1.3はプロプライエタリ、1.2の公開は依然不透明
最も重要な論点の一つが、Metaのオープンウェイト戦略の不透明さだ。8月に発表されたMuse Spark 1.2は完全なプロプライエタリモデルであり、過去にLlamaで築いた「オープンAI」の路線から大きく転換したと報じられた。しかし、その5日後、Metaは突如として30BパラメータのMuse GlimmerをApache 2.0ライセンスで公開。ザッカーバーグ氏は「数週間以内にMuse Spark 1.2のウェイトも公開する」と明言した。
だが、今回リリースされたのはMuse Spark 1.3であり、再びプロプライエタリモデルとして提供された。ザッカーバーグ氏は「Muse Sparkのオープンウェイトリリース」が近日中にあると述べているが、バージョン名やリリース日、モデルサイズ、ライセンスの詳細は一切不明だ。
Llamaに依存してきた開発チームにとって、自己ホスティングやカスタマイズ、推論コストの最適化が可能なオープンウェイトモデルの将来像が見えないことは、新たなベンチマークスコアの数ポイントよりもはるかに重要な不確実性である。
Muse Spark 1.3は、Metaがプロプライエタリなフロンティアモデルを驚異的な速度で反復できることを示した。xhigh構成は高速で、競争力のある価格であり、独立したランキングの上位に確かに位置している。maxプレビューは、さらなる推論リソースを投入すれば、そのポテンシャルをさらに引き出せることを示している。
しかし、次の課題は、企業が実際に計画を立てられるロードマップを示すことだ。すなわち、最上位の機能を広く展開可能にし、すでに公開を約束しているオープンウェイトのMuse Sparkをいつ、どのような形で提供するのか。Metaは、この点について明確な答えを示さなければならない。単なるベンチマーク競争を超え、AIプラットフォームとしての信頼を勝ち取れるかが、真価を問われる局面と言える。