Artificial Analysisは、AIモデルの総合性能を測る「インテリジェンス指数」の最新版となるバージョン4.2を公開した。これは、GPT-6 Astraの実力を正しく評価できていないという批判を受け、同指数をアップデートしたものだ。今回の改訂により、GPT-6 Astraは従来モデルと比較して4ポイントの向上を示し、単独2位に浮上した。
Astraの実力をめぐる評価の乖離
GPT-6 Astraをめぐっては、複数の評価機関で結果が分かれていた。OpenAI自身の評価を含むいくつかの指標では、Astraが競合を大きく引き離しているとされていた。具体例として、Epoch AIのランキングでは、267モデル中1位、50以上のベンチマークを横断したスコアは169ポイントを記録。ARC-AGI-3においても、評価環境によっては顕著な性能向上が確認されていた。
しかし、Artificial Analysisの旧バージョンでは、Astraは前世代モデルと同等の評価にとどまっていた。この乖離が「Astraの進歩を過小評価している」との批判を招き、今回の指数改訂につながった。
バージョン4.2の主な変更点
アップデートされたインテリジェンス指数 v4.2では、GPT-6 Astraは前世代のSolに対し、4ポイントのスコア差をつけることに成功した。従来のバージョンでは両モデルが同点だったことを踏まえると、この差は顕著な改善と言える。ただし、ランキング全体の首位は依然としてAnthropicのClaude Fable 5.1が保持しており、Astraは2位、3位にMetaが続く構図は変わらない。
今回の改訂では、新たに2つのベンチマークが追加された。1つは実務的な知識作業を評価する「AA-Briefcase」、もう1つはPDF文書解析能力を測る「GDP.pdf(Surge AI)」である。一方、多くのモデルが解答可能なレベルに達したため、GPQA-Diamondはベンチマークから除外された。
評価の信頼性を高めるため、非公開テストデータの重みづけが全体の40%に引き上げられた。これは、公開データを利用した「ゲーミング」を防ぐ意図がある。また、複数のベンチマークで採点の誤りが修正され、スコアの安定性を高める調整も実施された。
一貫性と速報性のバランス
Artificial Analysisは、主要モデルの発表が相次ぐ中でスコアの安定性を保つため、意図的にアップデートを控えていたと説明している。しかし、リーダーボードの上位変動があまりに激しく、暫定的なアップデートが不可避と判断したという。同社は現在、バージョン5の開発を8カ月にわたって進めており、今回のバージョン4.2は、その完成を待つ間に公開された「中間報告」的な位置づけとなる。
コスト効率と実用性の評価
Artificial Analysisの分析によれば、GPT-6 Astraはタスクあたりのトークン消費量が他のフロンティアモデルと比較して最も少ない。これは、実運用におけるコスト効率の高さを示している。さらに、コスト対性能比の分野では、Anthropic、OpenAIa、Meta、そして中国のZhipu AIが拮抗しており、この領域では明確な勝者が存在しない状況だ。
これらの結果は、AIモデルの評価が単一の指標では判断できない複雑な領域に突入していることを示している。評価指標の改訂が進むにつれ、各モデルの真の実力がより正確に可視化されることが期待される。特に、バージョン5がどのような枠組みで構成されるのか、業界の注目が集まっている。