動画に映る物体の動きや物理現象を、単なるピクセルの予測ではなく、物理エンジンで実行可能なコードとして表現する新たなパラダイム「Code-as-World」が、MirroSによって公開された。この技術は、動画から物理世界の構造を抽出し、それを検証可能かつ編集可能なプログラムに変換するもので、機械学習やロボティクスの分野に新たな地平を切り開く可能性を秘めている。
従来のビデオモデルは、未来のフレームをピクセルレベルで予測することに長けているが、その内部に質量や接触、重力といった物理的な実在を表現しているわけではない。MirroSの主張は明確かつ検証可能な形で提示されている。「ピクセルは物理シーンの証拠であって、その存在論(オントロジー)ではない」という立場から、彼らはシーンを潜在変数やキャプションではなく、実行可能なコードとして表現する手法を採用した。
Code-as-Worldとは何か——「scene.json」が世界を定義する
この技術の中核を成すのが、Executable World Representation(EWR)と呼ばれる概念である。具体的には、シーン全体を単一のJSONファイル「scene.json」として記述する。このファイルは物理シミュレータ「MuJoCo」が直接読み込んで実行できるフォーマットで記述されており、エージェントが元の動画と照合して検証することも、人間が手動で編集して再シミュレーションすることも可能になる。
EWRは三つの主要な要素から構成される。Composition(構成)は、シーンに存在するオブジェクトの種類(動的剛体、静的剛体など)、ジオメトリ、質量、摩擦、重力といった物理定数を定義する。床や壁も「静的な物理的実体」として扱われ、接触や衝突の計算に参加する。Evolution(進化)は、シーンの時間的な展開を記述する。初期状態の速度ベクトル、接触イベントのタイムスタンプ、シミュレーターのバックエンド設定などが含まれ、これを実行することで完全な状態遷移の軌跡が得られる。Appearance(外観)は、カメラモデル、レンダリング設定、背景、フレームレートなど、物理とは独立した視覚的な属性を管理する。
発見ループ——実動画から世界を復元する5ラウンドのプロセス
MirroSが特に革新的なのは、実動画からこれらの実行可能な世界表現を自動的に復元するエージェンティックループを構築した点にある。このループは最大5ラウンドで構成され、以下のステップを反復する。
- Propose(提案):エージェントが入力動画の証拠(デプス、マスク、トラッキング情報)と、前ラウンドの誤差(Δ)に基づいて、新たなEWRを仮説として生成する。
- Instantiate(実体化):提案されたEWRを、シミュレーターが実行可能なパラメーターにコンパイルする。
- Execute(実行):MuJoCoがパラメーターに従って物理シミュレーションを実行し、状態、接触、衝突の情報を生成する。
- Render(レンダリング):シミュレートされた状態を、RGB画像、デプスマップ、マスク、トラッキング情報として再投影する。
- Verify(検証):キーフレームにおいて、シミュレーション結果と元の動画を比較する。誤差が許容範囲内であれば採用、そうでなければ誤差を集約して次のラウンドに回す。
このループを通じて、最初は大まかだった仮説が徐々に精緻化される。報告書によれば、初回の仮説はデプスとマスクとトラッキングから生成されるが、接触のタイミングは早い段階で正しく推定される一方、ボールの軌道にわずかなずれが生じるといった具合に、ラウンドを重ねるごとに現実の動画との一致度が高まっていく。5ラウンドの予算内で受け入れられなければ、仮説は却下されるという厳格なルールが設定されている。
検証された世界が生む、高品質な教師データ
この手法の価値は、復元された世界の質そのものだけではない。検証済みのEWRは、正確な物理ラベルが付与されたトレーニングデータとして利用できる点にある。実動画には重力のベクトルや物体の質量といったラベルは存在しないが、Code-as-Worldを通じて生成されたシミュレーションデータは、それらの物理量を完全に保持している。
この教師データを用いてファインチューニングされたモデルが、Code-as-World-VL-9Bである。Qwen3.5-9Bをベースにしたこのビジョンランゲージモデルは、物理量の推論ベンチマーク「QuantiPhy」のバリデーションセットにおいて、55.4 MRA(Mean Relative Accuracy)を達成した。これはGemini 3.1 Flashの54.8を上回る数値であり、オープンウェイトの最強ベースラインを約15ポイント引き離す結果となっている。より小型のCode-as-World-VL-4B(Qwen3.5-4Bベース)も公開されている。
Apache 2.0ライセンスで公開、研究段階ながら実用的なデプロイが可能
現在のところ、Code-as-Worldは「研究および内部プロトタイプ向け」の位置づけとされている。しかし、その公開範囲は極めて実践的である。GitHubリポジトリに加え、Hugging Face上に二つのチェックポイント(4Bと9B)がApache 2.0ライセンスで公開されている。両モデルはBF16のsafetensors形式で提供され、vLLMを通じてOpenAI互換の/v1エンドポイントで推論を実行可能だ。動画1本あたり16フレームをサンプリングし、--max-model-len 4608の設定で動作するよう設計されている。
MuJoCoのシミュレーション結果を再度レンダリングし、カメラアングルを変更して同一の衝突シーンを複数の視点から再表示するといった操作も、既に報告書内で実証されている。これは世界がプログラムとして表現されていることの本質的な利点であり、一度復元された物理環境は、自由に編集し、異なる条件下で何度でも再実行可能であることを示している。
業界へのインパクトと今後の展望
この技術が目指すのは、ビデオ理解の新たな標準を確立することだ。ピクセルレベルの予測が得意な大規模ビデオモデルは数多く存在するが、それらは物理的な因果関係を内在的に理解しているわけではない。Code-as-Worldは、モデルに「物理をコードとして表現する」という能力を与えることで、シミュレーションと現実のギャップを埋める試みと言える。
特に注目すべきは、この手法がロボット学習
におけるデータ生成の効率を劇的に向上させる可能性を秘めている点だ。実世界でロボットにタスクを学習させるには膨大な量のデータが必要だが、Code-as-Worldによって検証済みの物理パラメーターが自動生成されれば、シミュレーション環境で高品質なトレーニングデータを無限に生成することが可能になる。また、ゲーム開発やVFXの分野においても、動画から自動的に物理的なシーンを復元する技術として応用が期待される。
現時点では研究段階のプロトタイプであるが、Apache 2.0のもとでモデルとコードが完全に公開されたことにより、世界中の研究機関や企業がこの技術を検証し、改良する土壌が整った。QuantiPhyにおける顕著なスコアは、このアプローチが単なる理論的な枠組みではなく、実際にパフォーマンスの向上に寄与することを示している。物理世界をコードとして捉え直すこのパラダイムシフトが、AIによる世界理解の次のステージを切り開くのか、その動向に注目が集まる。