CUA-Lite、コンピュータ使用エージェント向けオープンプラットフォームを公開

UC Berkeleyが開発したCUA-Liteは、コンピュータ使用エージェントのトレーニングと評価を統合するオープンプラットフォームです。

投稿者 central
CUA-LiteはDocker環境で動作し、VM不要でメモリ使用量を約4.6倍削減します。
ハイライト
  • Lite.OSWorldは従来のOSWorldのVMをDockerコンテナに置き換え、メモリ消費を4.1GBから0.9GBに削減しました。
  • CUA-Liteはエージェント、環境、トレース、フレームワークを単一のアクションスペースとデータスキーマで統合します。
  • 3万以上の検証可能なタスクと15以上のベンチマークがHugging Faceで無料公開されています。

カリフォルニア大学バークレー校(UC Berkeley)の研究チームは、コンピュータ使用エージェント(CUA)のためのオープンプラットフォーム「CUA-Lite」を公開した。このプロジェクトの根底にあるのは、モデル中心主義ではなく、インフラストラクチャの統合という思想だ。従来、CUAのトレーニングとベンチマークには、エージェント、環境、トレース、そしてそれらを評価・訓練するフレームワークという4つの要素が必要であり、これらは互換性のないインターフェースを持つ別々のリポジトリに分散していた。CUA-Liteは、これらすべてを単一のアクションスペース、単一のデータスキーマ、単一のコマンドで統合し、デスクトップ、ブラウザ、モバイルの各プラットフォームに対応する。

導入の容易さも大きな特徴だ。スタックはPython 3.12上でuv sync --all-extrascodeというコマンド一つでインストールでき、軽量なサンドボックスは/dev/kvmcodeを必要とせず、あらゆるDockerホスト上で動作する。これにより、クラウドインスタンス、CIランナー、ネストされたコンテナなど、様々な環境での実行が可能となった。

VM税の解消──Lite.OSWorldが実現した軽量化

今回の発表で最も具体的で重要な貢献が、「Lite.OSWorld」だ。従来のOSWorldaは、タスクごとにQEMU/KVMの仮想マシン(VM)を起動する方式を採用しており、そのためにはネストされた仮想化(入れ子になった仮想化機能)が必要だった。しかし、多くのマネージドインフラストラクチャではこの機能が提供されておらず、これがOSWorld普及の大きな障壁となっていた。

CUA-Liteは、この課題を根本から解決する。Lite.OSWorldでは、同じタスクスイートと評価器を、通常のDockerコンテナ内で動作するGNOMEデスクトップ上に再現している。比較表を見れば、そのインパクトは一目瞭然だ。OSWorldが仮想マシン一台あたり4.1GBのメモリを消費し、コールドスタートに29.9秒を要するのに対し、Lite.OSWorldはわずか0.9GB、23.8秒で起動する。つまり、同じホストメモリ上で約4.6倍もの並列インスタンスを実行できる計算になる。

「VMをコンテナに置き換えた場合、動作の忠実性(Fidelity)が損なわれるのではないか」という懸念に対しては、研究チームは明確なデータで応えている。13のモデルでテストした結果、Lite.OSWorldのスコアはOSWorld VMのスコアと一致しており、コンテナ内で獲得したスコアやトレーニング信号は、そのまま本来のベンチマークに転用できることが確認された。この基盤はさらに拡張され、Lite.ScaleCUA、Lite.CUAGym、そして約40ものアプリケーション(Blender、QGIS、VS Codeなどを含む)をカバーするLite.CUAWorldへと展開。プラットフォーム全体では、3万以上の検証可能なタスクを提供すると謳われている。

統一データスキーマ「LiteSample」とモデルアダプタ

CUA-Liteの第二の重要なレイヤーが、「LiteSample」という統合スーパーバイズドラーニングスキーマだ。これは、あらゆる環境、エージェント、タスクタイプで共通して利用できるフォーマットで、parquetファイルと画像として提供される。既存の10以上のCUAデータセット(Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey、Multimodal-Mind2Webなど)がこのスキーマに前処理され、Hugging Facea上で無料公開されている。さらに、フロンティアレベルの教師モデルをサンドボックス内でロールアウトして生成した、新しい「ロールアウトデータセット」も公開されており、より小型の学生モデルへの知識蒸留に活用できる。

モデルファミリーごとに必要なスキャフォールディング(モデルを動かすための枠組み)が異なるという現実問題に対処するため、フレームワークはモデルごとのアダプタを提供する。このアダプタは、統合フォーマットであるLiteSampleを各モデルのトレーニング形式に変換し、複数のステップを一つのフォワードパスにまとめるヒストリーコラプシング(履歴の圧縮)機能も備えている。

評価からSFT、RLまでを一つのコマンドで

エージェントと環境は「lite.gym」で接続される。これは、スクリーンショットを受け取り、アクションを出力するというシンプルなインターフェースで、プラットフォームごとに一つのアクションスペースが定義されている。GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UIなど10以上のエージェントがビルトインされており、ScreenSpot-ProやOSWorld-Gといったグラウンディング系、OSWorldやWindowsAgentArenaなどデスクトップ系、WebArena、VisualWebArena、MiniWoBなどブラウザ系、AndroidWorld、AndroidLab、MobileWorldなどモバイル系、合計15以上のベンチマークが統合されている。ユーザーは、scripts/rollout.pycodeで--model-idcodeと--env-idcodeを指定するだけで、これらの組み合わせを自由に変更できる。

このロールアウトループは、トレーニングにもそのまま利用できる。SFT(教師ありファインチューニング)の例として、READMEではQwen3-VL-2B-InstructをLite.ScaleCUAのデスクトップ軌跡データでファインチューニングし、332タスクから成るlite.osworld評価セットにおいて、平均エピソードリターンを0.138から0.237に向上させたことが報告されている(2GPUでの単一構成)。RL(強化学習)については、環境内でスコアリングされたロールアウトを利用し、Slimeトレーナー上でGRPO更新を行う手法が示されており、28アプリケーション、416モバイルタスクをカバーするMobileGymの実例が提供されている。

インタラクティブな解説で理解を促進

こうした一連の仕組みを視覚的に理解できるよう、プラットフォームのWebサイトにはインタラクティブな解説機能が組み込まれている。これは、「統合」「VMの排除」「ロールアウトループ」「SFTの効果」という4つのタブで構成されており、スライダーを動かしてメモリ使用量の違いを体感したり、ループのアニメーションを再生してエージェントの動作を追ったりすることができる。

主な要点と今後の展望

CUA-Liteは、コンピュータ使用エージェントの研究開発において、インフラストラクチャの断片化という長年の課題に対して実用的な答えを提供するものだ。主な要点は以下の通りである。

  • エージェント、環境、トレース、トレーニングを、単一のアクションスペースと「LiteSample」スキーマで統合。
  • Lite.OSWorldは、OSWorldのタスクをVMなしのDockerで動作させ、メモリ使用量を4.1GBから0.9GBに削減、約4.6倍の並列実行を実現。
  • コンテナ内のスコアは13モデルにわたってOSWorld VMと一致し、トレーニング信号は本来のベンチマークに転用可能。
  • 3万以上の検証可能タスク、15以上のベンチマーク、10以上のエージェント、20以上のデータセットをHugging Faceで無料公開。
  • あらゆるDockerホストでデプロイ可能だが、リポジトリには明示的なライセンスがまだ付与されていないため、商用利用の際は条件を確認する必要がある。

CUA-Liteは、研究の再現性とスケーラビリティを大幅に向上させる可能性を秘めており、今後のエージェント研究の標準的なプラットフォームとなることが期待される。プロジェクトページ、GitHubリポジトリa、およびHugging Face上のデータセットが公開されており、誰でもアクセスして実験を開始できる環境が整えられた。今後の展開として、このプラットフォーム上でのコミュニティ主導のベンチマーク開発や、より多様な環境への対応が進むことが予想される。

この記事をシェア