元DeepMindの研究担当バイスプレジデントであったOriol Vinyals氏は、AIシステムによる再帰的自己改善(Recursive Self-Improvement, RSI)が避けられないプロセスである一方、その進展は緩やかであり、「突然の知能爆発」には繋がらないと明言した。同氏は、DeepMind退任後に行われた「Agentic AI Summit 2026」での講演でこの見解を詳述。さらに、AI研究における自己改善の最大の障壁に挑むべく、新たなスタートアップ「Discovery Loop」の立ち上げを発表した。
「自己改善」とは何を改善することなのか——Vinyals氏が問う基本定義
Vinyals氏は、まず「自己改善」という概念そのものに対する根本的な問いを投げかける。AIシステムにはニューラルネットワークの重み、学習データ、学習手法、プロンプト、外部ツール(データベースアクセスやコード実行環境など)、そして自身の進捗を測る評価指標といった、非常に多くの可変要素が存在する。システムが自己改善を図る際、これらのうちのどの要素を、どのように変更するのか、その定義自体が曖昧であり、技術的にも規制的にも異なる課題を伴うと指摘する。
自己改善を実現するためには、①改善のための有望なアイデアを生み出し、②それを実装するコードを書き、③実験を実行し、④その変更が実際に有効だったかどうかを判断する、という一連のサイクルが必要になる。Vinyals氏によれば、AIはすでに「コードの実装」と「実験の実行」という中間の2ステップでは大きな進歩を遂げている。しかし、アイデアの生成と結果の評価こそが、現在のAIシステムが最も苦手とする、二つの大きなボトルネックだという。
アイデア生成と結果評価——自己改善を阻む二つの難関
現在の多くの研究機関は、自己改善の進捗をSWE-Bench ProやML-Benchといった既存の能力ベンチマークで間接的に評価している。これらのテストは低コストで定義が明確だが、主にAIがすでに得意とする「実装」と「実験」の部分を測定しているに過ぎない。Vinyals氏は、これでは真の自己改善能力を測ることはできないと警鐘を鳴らす。
さらに深刻なのは、過学習や不正な方策への適応(いわゆる「ズル」)の問題だ。長年ゲームプレイエージェントの開発に携わってきたVinyals氏は、AlphaStarの事例などから、システムが本来のゲームとは無関係にスコアを最大化しようとする「仕様の抜け穴」を悪用する傾向を熟知している。自己改善の評価においても、システムが評価指標だけを最適化し、本来の目的を達成しないリスクは常につきまとう。
真に意味のある自己改善の評価には、システムにメトリクスと計算予算を与え、どれだけ自身を改善できたかを直接測定する新しいベンチマークが必要になる。しかし、このアプローチは極めて高コストだ。エージェントが本来の研究目的とはかけ離れたタスクに長時間取り組む必要があり、Vinyals氏は「テトリスを最適化させるエージェントを評価しても、それが世界最高のAIモデルを自動構築する研究ラボの自動化には繋がらない」と具体例を挙げて説明する。
一方、アイデア生成の分野はさらに未発達である。優れた研究には、どのアイデアに価値があるのかを見極める「研究の嗅覚(リサーチテイスト)」が不可欠だが、大規模言語モデル(LLM)の学習において、この能力をどう教え込むかはほとんど研究されていない。Vinyals氏は将来的な評価では、システムがどの程度改善したかだけでなく、どのようなプロセスで改善に至ったかも評価されるべきだと提言する。具体的には、会議の査読者が用いる独創性、エレガントさ、効率性、そして時間による検証といった基準が適用されるようになるだろうと予測。これらの基準の一部はルール化や報酬モデルで網羅し、強化学習で訓練することは可能だが、その実現は非常に困難であり、時間を要すると述べている。
物理的限界と人間の上限——知能爆発が起きない理由
Vinyals氏はさらに、思考実験の域を超えた物理的制約にも言及した。チップの動作速度は光速と設計上の限界に縛られているため、AIがより優れたアルゴリズムを設計したとしても、それを実行するハードウェアの物理的制約から逃れることはできない。また、特定の分野では、すでに人間の性能が理論上の上限に近づいている可能性があると指摘。囲碁AI「AlphaGo」の完璧なプレイと比較して、その実力がどれほどのものかは誰にも分からないと述べ、一概に「AIが人間を凌駕した」と評価することの難しさを示唆した。
これらの理由から、Vinyals氏は自己改善が突然加速し、制御不能な知能爆発を引き起こすというシナリオは非現実的であると結論づけている。
Discovery Loop——二人のボトルネックを自動化するスタートアップ
Vinyals氏は自身の分析を実践に移すため、新会社Discovery Loopを設立した。CEOにはJeff Dean氏、共同創業者にはGoogleのシニアフェローであるSanjay Ghemawat氏、Google Brainの共同創業者であるQuoc Le氏が名を連ねる。4人の創業者のうち3人がAI分野で最も引用されている研究者の一人であり、Ghemawat氏は分散システム分野でその地位を確立している。
同社の目的は、仮説の立案から実験の実行、結果の評価に至るまでの科学研究の全サイクルを自動化することにある。まずは自社を最初の顧客と位置づけ、AI研究の自動化に着手。その後、他の科学分野へと適用範囲を拡大する計画だ。同社のウェブサイトでは、「少人数のチームが、今日の大規模な科学者・エンジニア集団よりもはるかに迅速かつ高品質に科学研究とエンジニアリングタスクを遂行できる未来」を描いている。Vinyals氏は、当面はアイデア生成が最も困難な部分であると認めており、初期段階では人間とAIが協力して仮説を共同開発するアプローチを取るとしている。
突如として訪れる「シンギュラリティ」というSF的なシナリオを退け、地道な研究プロセスそのものの自動化に焦点を当てたDiscovery Loopの挑戦は、AI業界における現実的で着実な進化の道筋を示していると言えるだろう。