AIモデルの性能を評価するベンチマーク業界に、新たなスタンダードを打ち立てようとするスタートアップが現れた。Valsは、Andreessen HorowitzがリードするシリーズAラウンドで4000万ドル(約62億円)を調達した。同社は、AI企業が自社モデルの性能を宣伝するために利用してきた既存のベンチマーク手法が、急速に進化する業界の実態に追いついていないという問題意識から2024年に設立され、わずか2年足らずで業界の注目を集める存在へと成長している。
ベンチマークは、AI企業が自社モデルの性能を検証し、競合他社との差別化を図るための事実上の業界標準となっている。優れたベンチマーク結果は、そのまま強力なプロモーションツールとして機能するのも事実だ。しかし、そのシステムはすでに綻びを見せ始めている。多くの既存ベンチマークは設計から時間が経過しており、現代の高度なモデルの能力を正確に測定するようには作られていない。さらに悪いことに、一部の企業はテスト問題を事前に学習することで、実力以上のスコアを不正に獲得する方法をすでに発見している。
「壊れた」ベンチマークを代替へ——Valsの使命
「新しい非常に高性能なモデルが次々と市場に出てくる中で、学術的なベンチマークはその最先端の進歩に追いついていませんでした」と、25歳の共同創業者Rayan Krishnan氏は語る。AIが社会の隅々に浸透する現在、ベンチマークは企業が宣伝する通りの性能をモデルが実際に発揮できるかを検証するためにこそ存在すべきだというのが、同氏の主張だ。
Valsの最大の差別化ポイントは、評価手法そのものにある。多くの既存ベンチマークが公開されたテスト問題を使用するのに対し、Valsは具体的なテスト内容を公開しない。これにより、企業が評価データを使って事前に訓練する「カンニング」を防止する。さらに、単にモデルの一般的な知識を問うのではなく、法律、金融、コーディングといった特定の業界に関連する複雑なタスクを遂行できるかどうかを評価する。
「私たちが行っているのは、モデルが実際にもたらす現実的な影響を見極めることです。各ドメインにおいて、人間と同等の品質の成果物を生み出せるのか」。Krishnan氏はこう説明する。同社の評価はポジティブな結果だけでなく、ネガティブな結果も対象とする。「これらのモデルが野放しになった場合、どのような悪影響が生じるのか」を分析することを目指している。
ベンチマークの対象領域は急拡大——自己改善からジュネーブ条約まで
Valsが測定する能力領域は急速に拡大している。従来の産業分野に加え、ユニークな領域への進出も進んでいる。「再帰的自己改善に関するベンチマーク、メンタルヘルス、サイバーセキュリティ、バイオセキュリティ、さらには武力紛争法に関するベンチマークも開発しています。モデルがジュネーブ条約をどのように適用するかを理解する試みです」とKrishnan氏は語る。
企業は自社モデルのテストを依頼するためにValsに料金を支払う。一見すると、自社モデルの不十分さを知るために対価を払うというのは奇妙なビジネスモデルに映るかもしれない。しかしKrishnan氏は、これを「学生がSATを受験するためにカレッジボードに料金を払うのと同じ」と例える。効果的な測定は、企業が問題を特定し、時間をかけてモデルを改善するための重要な手段となるのだ。
こうした評価は、AIモデルを導入しようとする企業にとって、重要な意思決定の要素になりつつある。
急成長を遂げるVals——売上8倍、人員も3倍
Valsの成長は加速している。同社が最近明らかにしたところによると、売上高は前年比で8倍に拡大。人員も年初の8名から25名へと3倍に増加した。Krishnan氏は、さらなる成長を見据えてより広いオフィスへの移転を計画しており、追加で10~15名の採用を予定しているという。また、連邦政府機関向けにモデル評価を提供するプログラムも最近開始した。
Krishnan氏は、自社のベンチマークシステムがAI企業のビジネス成長と社会的信頼構築の未来を形作ると確信している。「AI企業が上場し始めています。SpaceXは上場し、Anthropicは年内に上場する見込みです。OpenAIも近いうちに上場するでしょう。AIモデルが経済の中核となり、より広く普及するにつれて、私たちが行うベンチマークや評価は、これらの企業が公開書類を提出する際や、AIへの投資計画を語る際の中心的な要素になるはずです」と同氏は展望する。