Claude Fable 5.1、52.6%達成と75%コスト削減で正式公開

AnthropicがClaude Fable 5.1を正式公開。ベンチマークで52.6%を達成し、コストを75%削減した最新AIモデル。

投稿者 central
Claude Fable 5.1のベンチマーク結果とコスト削減の概要
ハイライト
  • Claude Fable 5.1はTerminal-Bench-Scienceで52.6%を記録し、前世代を大きく上回った。
  • キャッシュ読み取り価格が75%削減され、長時間稼働するエージェントに有利。
  • Mythos 5.1はプロテインバインダー設計で約50%のヒット率を達成した。

Anthropicは2026年9月、最新モデルとなるClaude Fable 5.1およびClaude Mythos 5.1を正式公開した。6月に投入されたFable 5シリーズから約3カ月でのアップデートとなる。両モデルは同一の基盤ウェイトを共有しながら、適用されるセーフガード層のみが異なるという特異な構成を採用している。

Fable 5.1はAPI識別子claude-fable-5-1codecodeとして、Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundryの各プラットフォームで一般利用が可能だ。一方、Mythos 5.1はProject Glasswingの枠組みを通じて、審査を通過した米国組織に限定して提供される。

ベンチマークで示された52.6%──その意味

最も注目を集めているのは、エージェント型科学研究ベンチマーク「Terminal-Bench-Science 0.1」におけるスコアだ。Fable 5.1は52.6%を記録し、前世代のOpus 5(29.0%)、Fable 5(24.7%)、さらに競合となるGPT-5.6 Sol(22.4%)を大きく引き離している。Anthropicは各モデルに3.5〜4.5ポイントの標準誤差があると報告しており、ランキングそのものより誤差幅を踏まえた評価が求められる。

Terminal-Bench 4.0では、Fable 5.1が55.8%、Mythos 5.1が60.9%を達成した。両者の差はセーフガードによる介入コストに相当する──つまり、同じモデルに異なる安全層を重ねた結果生じたギャップであり、Anthropicがこれを明示した点は異例の正直さと言える。

その他のベンチマーク結果は以下の通りだ。

  • CursorBench 3.2.0:73.4%
  • Humanity’s Last Exam:ツールなし60.9%、ツールあり65.0%
  • AutomationBench:31.4%
  • OSWorld 2.0(厳格評価):41.7%
  • GDPval-AA v2:1853(レーティング評価)

75%のキャッシュ読み取りコスト削減──実質負担への影響

商用利用者にとって最も実務的なニュースは、キャッシュ読み取り価格が75%引き下げられた点だろう。従来の$1.00から$0.25(100万トークンあたり)へと変更された。これはベース入力価格の0.025倍に相当し、他のClaudeモデルが0.1倍であるのと比較すると大幅な改善となる。

なお、ベースとなる入力価格($10/100万トークン)と出力価格($50/100万トークン)は変更されていない。バッチ処理はそれぞれ$5、$25に設定されている。

Anthropicの試算によれば、標準的なワークロードで約25%、コンテキスト重視のエージェント型ワークロードでは最大45%のコスト削減が見込めるという。キャッシュヒット率が高い用途ほど恩恵を受ける設計だ。

移行時に直面する3つの破壊的変更

既存のFable 5からFable 5.1へ移行する開発者チームは、以下の変更点に注意する必要がある。

強制ツール使用(forced tool use)の廃止

tool_choicecodecodeにanycodecodeまたはtoolcodecodeを設定するとHTTP 400エラーが返される。代わりにautocodecodeと厳格なツール使用、あるいは構造化出力を利用する必要がある。

思考ブロックのモデル依存

Fable 5.1は旧モデルの思考出力を読み取れるが、旧モデルはFable 5.1の思考ブロックを解釈できない。ルーターやフォールバック構成を組んでいる場合、ダウンストリームで推論の連鎖が途切れることになる。

過去ターン編集による思考ブロック無効化

ターンごとのリマインダーを途中で挿入・削除したり、systemcodecode配列やtoolscodecode配列を会話中に再構築するとエラーが発生する。このチェックは2026年8月31日以降に作成されたアカウントで有効となる。回避策として、ターンスコープのシステムメッセージとサーバーサイドのコンテキスト編集が推奨されている。

追加機能と認識されている退行

新たな機能として、メッセージ単位の努力量調整(per-message effort)、ターンスコープのシステムメッセージ、thinking.display: "updates"codecodeがベータ提供されている。また、すべての出力に統計的テキスト透かしが付与され、ファイルにはC2PA認証情報が添付される。コンテンツの来歴証明はもはやオプションではない。

一方、Anthropic自身が公表している退行も存在する。並列ツール呼び出しのばらつきが増加しており、エージェントループが1ターンあたり1回の呼び出しに制限される傾向がある。また、モデルのナレーションが減少し、低努力設定ではメモリからの回答が増加。コード編集においては、対象を絞った修正よりもファイル全体の書き換えを好む傾向が確認されている。

セーフガードの再設計と科学研究の成果

サイバーセキュリティ関連のセーフガードは大幅に緩和された。脆弱性の発見は許可されるが、エクスプロイトの開発は許可されない。この調整により、Claude Codeのセッションあたりの介入件数は約60%削減されたという。生物学関連のセーフガードも、良性のリクエストに対する発動が85%減少している。ただし、ペネトレーションテスト、エクスプロイト生成、バイナリベースの脆弱性スキャンは引き続きOpusにリダイレクトされる。

研究用途においては注目すべき成果が報告されている。Mythos 5.1は12の標的に対して約50%のヒット率でプロテインバインダーを設計。Fable 5.1は金星の標高マップを2〜3kmの解像度で生成した。さらに、カスタムGPUカーネルにより7種類のオープンソースゲノミクスモデルを最大2.5倍高速化した。

Claude Fable 5.1は、単なる性能向上に留まらず、運用コストの現実的な削減とセーフガードの精緻化を同時に実現した点で、企業導入における実用性を大きく高めたと言える。特にキャッシュ読み取り価格の引き下げは、長時間稼働するエージェント型システムにとって極めて有利に働く。移行に際しては破壊的変更への対応が前提となるが、総合的なTCO(総所有コスト)で見れば、多くの開発チームにとって検討に値するアップデートであることは間違いない。

この記事をシェア