トークンコスト28%削減、AWSのStrands Harnessがオープンソースで登場

AWSが公開したStrands Harnessは、LLMエージェントのトークンコストを28%削減するオープンソースの汎用ハーネスです。

投稿者 central
ハイライト
  • Strands Harnessはトークンコストを従来比28%削減する。
  • Apache 2.0ライセンスで公開され、PythonとTypeScriptに対応する。
  • Strands Harnessはcreate_harness()を呼び出すだけで即座にエージェントを起動できる。

AWS(Amazon Web Services)のStrands Agentsチームは、汎用エージェントハーネス「Strands Harness」をオープンソースとして公開した。同ハーネスを採用することで、ClaudeやGPTといった大規模言語モデル(LLM)を搭載したエージェントのトークンコストを、従来のハーネスと比較して平均28%削減できるという。精度はほぼ同等に保たれたままだ。

ソースコードはApache 2.0ライセンスのもとで提供され、PythonおよびTypeScriptの両方に対応。ローカル環境での実行に加え、AWS、GCP、Azure、Cloudflare、Modalといったクラウドプロバイダへのデプロイも想定されている。わずか1行のコードからエージェントを起動できる点も、大きな特徴だ。

Strands Harnessとは何か——エージェント開発の「差」を埋める設計

多くの開発者は、Claude CodeやCodexの内部ではうまく動作していたエージェントのアイデアが、独自のループで再構築した途端に機能しなくなる、という問題に直面してきた。Strands Harnessは、このギャップを埋めるために設計された、フルアセンブル済みの汎用エージェントハーネスである。

ハーネスとは、モデルの周辺で動作するシステム全体——ループ、ツール、コンテキスト処理、メモリ、障害復旧——を指す。Strandsチームはすでに「Strands Harness SDK」を通じてこれらの構成要素を提供していたが、今回のStrands Harnessはそれらを実用的なデフォルト設定としてパッケージ化したものだ。なお、本製品はコーディング専用エージェントではなく、汎用エージェントとして設計されている点も、押さえておきたい。

create_harness()codecodeを呼び出すだけで、以下の機能を備えたエージェントが即座に利用可能となる。

  • Amazon Bedrock、Anthropic、OpenAI、Google、Ollama、LiteLLMを通じた最新の推論モデルでの実行
  • シェル、ファイル操作(読み取り・書き込み・編集)、Webツールの標準搭載
  • サイズの大きいツール結果のファイルへのオフロード、リクエストの再利用部分のキャッシュ
  • 実行をまたぐ長期メモリの保持、セッションIDによる会話の再開
  • 内蔵ヘルパーエージェントへのサブタスク委譲、チェックリストによるマルチステップ作業の追跡
  • Agent Skillsの自動ロード

28%削減の根拠——6ベンチマークによる検証結果

Strands Agentsチームは、Amazon EC2上で分散ベンチマークを実施。評価フレームワークには、Terminal-Benchの開発者が手がける「Harbor」を採用した。スコアは、ALFWorld、ContextBench、GAIA、WebShop、τ²-bench、Terminal-Bench 2.1の6ベンチマークの平均値である。比較対象は、Claude Code、Codex、oh-my-pi、OpenCode、DeepSeek Harnessの5つだ。

注目すべきは、DeepSeek Harnessがトークン効率では全ハーネス中トップで、Strands Harnessより約14%低コストだったという点だ。しかし、DeepSeek HarnessはすべてのベンチマークでStrands Harnessを下回った。グラフの注釈によれば、DeepSeek Harnessを含めたことで、全体のコスト削減率は28%という数値になった。また、最高スコアを記録したのは、Strands Harness上で動作するClaude Opus 5で、スコアは85%近くに達した。

同一モデルでの直接対決——Terminal-Bench 2.1の結果

もっとも明確な比較は、Claude Fable 5をTerminal-Bench 2.1で動作させたケースだ。各ハーネスにつき89回の試行が行われ、以下の結果が得られている。

ハーネス 実行コスト 精度
Strands Harness $56.29 69.7
Oh-my-pi $86.83 69.7
OpenCode $73.42 66.3
Claude Code $248.05 61.8
DeepSeek Harness $40.30 59.5

Claude Codeと比較すると、Strands Harnessはコストが77%低く、スコアは7.9ポイント高い。Oh-my-piとは精度で並んだものの、コストは54%高い。DeepSeek Harnessはさらに低コストだが、精度で10.2ポイントの差をつけられた。チームは、他の2つのオープンソースハーネスも、Claude Code対比でコストと精度の両面で良好なパフォーマンスを示したと付け加えている。

効率性の源泉——コンテキスト管理の3ルール

Strands Harnessの効率性は、プロンプトキャッシングとコンテキスト管理のデフォルト設定に支えられている。チームによれば、コンテキスト管理こそがトークン効率と精度の両方を押し上げた主因だという。具体的には、次の3つのルールが機能している。

  • 約1,500トークンを超えるツール結果は切り詰められる
  • コンテキスト使用量が85%を超えた時点で、要約(コンパクション)が発動
  • ウィンドウがオーバーフローした場合、ループ内でコンテキスト回復が実行される

これらのアプローチは、最近の独立した研究結果とも一致している。HarnessTax研究では、Claude Code、Codex CLI、Piを7モデルにわたって比較。ハーネスの選択が成功率に与える影響はわずかである一方、同じモデルでも最大5倍のコスト差が生じることが示されている。Strandsチームは、自社のベンチマークに関するフォローアップ論文を準備中としている。

導入方法とカスタマイズ——1行から始める本番運用

導入はシンプルだ。Python環境であればpip install strands-harnesscodecode、TypeScriptであればnpm install @strands-agents/harnesscodecodeを実行する。モデルは名前で指定するか、ローカルのOllamaモデルをポイントすればよい。

from strands_harness import create_harness

agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("トップ3のベクトルデータベースを調査し、価格を比較してください")

prepre

さらに、CLIツール(npm install @strands-agents/strands-clicodecode)を使えば、平易な英語でエージェントをプロトタイピングできる。チームのデモでは、エージェントに「Playwright MCPサーバを追加し、ブログ記事の動画読み込みレイテンシを測定する」よう指示。その後/exportcodecodeを実行すると、Playwright MCPを含むハーネスコードがPythonまたはTypeScriptのzipとして出力された。このCLI自体もStrands Harness上に構築されている。

カスタマイズの自由度は高く、あらゆるデフォルト設定の上書き、モデルの交換、ツールの追加、Strands Harness SDKに至るまでのコンポーネント置き換えが可能だ。ハーネスはライブラリ依存関係として組み込まれるため、ノートPC上でプロトタイピングしたエージェントを、そのまま本番環境に埋め込むことができる。

今後の展望——エージェント開発のコスト構造を変える可能性

Strands Harnessの登場は、LLMエージェントの開発現場に実質的なインパクトをもたらす可能性がある。トークンコストが28%削減されるということは、とりわけ大規模な評価実験や反復的なプロトタイピングを行うスタートアップや研究機関にとって、開発速度と予算の両面で有利に働く。特に、同一モデルでもハーネスの選択次第でコストが5倍も変動するというHarnessTaxの知見を踏まえれば、ハーネス選びは単なる実装上の選択肢ではなく、プロジェクトの経済性を左右する重要な判断材料となる。

AWSが自社のクラウドサービスと密接に連携する形で、かつApache 2.0のオープンソースとして本ハーネスを公開したことの意味は大きい。競合するハーネス群との差別化は、単なるコスト削減率だけでなく、Bedrockや他モデルプロバイダとのシームレスな接続、そしてSDKレベルからのカスタマイズ性によっても図られている。エージェント開発の民主化が進むなかで、Strands Harnessが標準的な選択肢の一角を占める日も、そう遠くないかもしれない。

この記事をシェア