Meta AI(メタAI)とイリノイ大学アーバナ・シャンペーン校の研究チームは、AIエージェントの長期タスク実行能力を飛躍的に向上させる新フレームワーク「EvoHarness-RL」を発表した。この手法を用いることで、パラメータ数80億(8B)の小型モデル「Qwen3-8B」が、平均成功率96.9%を達成。これは、同分野で最高峰とされるClaude Opus 4.5(成功率96.4%)に匹敵する性能であり、計算コストの面で大きな優位性を示す結果となった。
EvoHarness-RLは、AIエージェントが外部環境から得た情報をどのように読み取り、更新し、統合するかという根本的な問題に取り組む。従来のエージェントは、人間の開発者が事前に定義したルールや手順に従って動作するため、真の自律性を持たない。複雑な企業向けワークフロー、例えば顧客データの大規模移行といった長時間にわたるタスクでは、エージェントは内部のコンテキストウィンドウだけに依存できず、実行基盤(ハーネス)への依存度が高まる。
このハーネスは、サーバーログなどの実行フィードバックを提供し、動的なAPI接続の状態を正確に把握する助けとなる。また、完了済みおよび未処理のサブゴールを管理する状態トラッカーや制御フロー機構も提供する。しかし、従来のアプローチでは、これらの仕組みは手動でコード化された固定ロジックに依存しており、モデルがアップグレードされるたびに再調整とデバッグの長期サイクルが発生するという課題があった。
EvoHarness-RLとは何か——BPEフレームワークの核心
EvoHarness-RLが従来手法と決定的に異なる点は、エージェントに「ハーネスの最適な使い方」を強化学習で教え込む点にある。研究チームは、エージェントの外部サポートシステムを「Belief(信念)」「Progress(進捗)」「Experience(経験)」という3つの機能領域に統合した統一インターフェース「BPE」を設計した。
このBPEフレームワークにおいて、エージェントは4つのメタアクション(track、commit、recall、note)を用いて、環境の追跡、ワークフローの更新、過去の戦略の想起、新たな知見の記録を実行する。これにより、複雑でドメイン固有のAPIを意識することなく、外部状態を管理できるようになる。
論文の共同執筆者であるXuying Ning氏は、このアプローチの重要性を次のように説明する。「従来の追記型メモリは、より多くのコンテキストが常に有益であるという前提に立っています。しかし、長時間のタスクにおいて、メモリには古い結論や失敗した試行、あるいはもはや関連性のない情報が蓄積され、むしろエージェントの推論を劣化させる可能性があります。長期的なタスクを処理するエージェントには、情報を更新し、圧縮し、置き換えることができる動的なメモリが必要なのです」
2段階トレーニングで実現した「コストを意識した学習」
EvoHarness-RLのトレーニングは、2段階のプロセスで構成される。第一段階では、教師あり学習によるハーネスの微調整(Supervised Harness Fine-Tuning)を実施。ベースモデルは、複雑なインタラクションログから有用な情報を抽出し、BPEフレームワークに構造化する方法を学習する。
第二段階では、「コストを考慮した強化学習(Cost-Aware Reinforcement Learning)」を適用する。メモリへの問い合わせやトラッカーの更新は、時間と計算トークンを消費する。そのため、エージェントはすべてのステップで盲目的に外部ツールを参照するわけにはいかない。このフェーズでは、エージェントが外部状態へのアクセスが予算コストに見合うかどうかを判断する能力を獲得する。これにより、ツールの使用が固定化されたプロンプトから、学習された実行時行動へと変換される。
実験結果——8BモデルがClaude Opus 4.5に匹敵
研究チームは、テキストベースのマルチステップタスク環境「ALFWorld」を用いて評価を実施。ベースモデルにはQwen3-8Bを採用し、以下の比較対象と対峙させた。
- フロンティアモデル:Claude Opus 4.5、GPT-4.1、GPT-5
- 静的フレームワーク:ReAct、ExpeL、ReasoningBank
- 学習可能な手法:標準GRPO、SkillOS、SkillRL
結果は鮮明だ。EvoHarness-RLを適用したQwen3-8Bは、ベースラインのReActと比較して49.0ポイントもの改善を達成。学習可能なフレームワークであるSkillRL(89.9%)やSkillOS(80.2%)を大きく上回った。そして最も注目すべきは、パラメータ数80億の小型モデルが、Claude Opus 4.5の96.4%というスコアに匹敵する96.9%を記録したことだ。これは、エンタープライズ開発者が計算コストを最適化する上で極めて重要な意味を持つ。
さらに、BPEフレームワークは強化学習フェーズを経ずとも、すべてのモデル規模で汎用的な利益をもたらすことが確認された。研究者が凍結状態のフロンティアモデルにBPEのプロンプトタイムハーネスを装備したところ、GPT-4.1の成功率は22.1ポイント、GPT-5は25.7ポイントそれぞれ向上した。
「ハーネスアニーリング」——エージェントが自律的に獲得する効率性
実験中に観察された興味深い現象が、「ハーネスアニーリング(Harness Annealing)」だ。トレーニング初期の段階では、AIはほぼすべてのステップでExperienceとProgressトラッカーに問い合わせを行っていた。しかし、ルーティンタスクを習得するにつれて、外部ツールへの依存度が能動的に低下。成功パターンを直接パラメータに埋め込むようになる。
これと同時に、エージェントは「ハーネス進化(Harness Evolution)」も示した。すなわち、単純なタスクではツールをバイパスする一方、未知の環境や予期せぬ障害に直面した瞬間には、BeliefモジュールとExperienceモジュールの使用を積極的に拡大する。例えば、標準的なデータベースレコードの移行中は高速に動作するが、奇妙なレガシーAPIエンドポイントや複雑なバリデーションエラーに遭遇した場合には、ライブサーバーログを取得し、過去のチケットを検索して安全に解決する——このような動的な行動戦略の適応が確認された。
既存システムへの統合と実務的な導入指針
新しいフレームワークの導入は、エンタープライズのエンジニアリングチームにとって摩擦を生む可能性がある。しかし、EvoHarness-RLは「環境アダプタ」を備えており、組織の既存ツールに特化した内部実装を維持しながら、学習可能なレイヤーを共有することを可能にしている。
Ning氏は次のように述べる。「BPEは、既存のオーケストレーションシステムに統合する大きな可能性を秘めています。チームが現在のツールやエージェントフレームワークを置き換える必要は必ずしもありません。BPEは、エージェントが現在何を信じているか、どこまで進捗したか、何を学んだかを継続的に整理する、追加の状態管理レイヤーとして機能します」
また、導入にあたっては、タスクの性質に応じた適切な判断が重要だ。短期間で安定したタスクにはReActや標準RAGで十分だが、数時間から数日、あるいは数週間にわたる複雑なシナリオにおいて、BPEは真価を発揮する。エージェントが自身の判断を圧縮して理解し、過去の失敗や人間のフィードバックから反復的に改善するために、Experienceへの依存が不可欠となる。
この研究は、AIオーケストレーションエンジニアにとって、ワークフローエンジニアリングの完全な置き換えではなく、「エージェントの行動を直接スクリプト化する」から「より良い行動を学習できるシステムを構築する」へのパラダイムシフトを示唆している。EvoHarness-RLは、小型モデルでも高度な推論と自律性を実現できる可能性を示すと同時に、エンタープライズAIの実装方法そのものに変革を促すものと言えるだろう。