Perplexity、マルチモーダル埋め込みモデル「pplx-embed-v2-late」公開。9B版がMADQAで92.4%獲得

Perplexityがマルチモーダル埋め込みモデル「pplx-embed-v2-late」を公開。9B版がMADQAで92.4%を達成。

投稿者 central
ハイライト
  • pplx-embed-v2-lateはテキストと画像、PDFページを同一の埋め込み空間で扱える。
  • 9B版が文書検索ベンチマークMADQAで92.4%の精度を達成した。
  • トークンあたり128次元のコンパクトなベクトルを採用し、運用コストを低減する。

Perplexityは、マルチモーダル情報検索の新たな選択肢として、ColBERTスタイルの埋め込みモデル「pplx-embed-v2-late」を公開しました。このモデルは、テキストと画像、PDFページを同一の埋め込み空間で扱える点が最大の特徴で、0.6Bパラメータの軽量版と、9Bパラメータの高品質版の2種類が提供されます。特に注目すべきは、文書検索ベンチマーク「MADQA」において、9B版が92.4%という高い精度を達成したことです。本モデルはMITライセンスで公開されており、商用利用も可能です。既存の高次元ベクトルモデルに比べ、トークンあたり128次元と非常にコンパクトなベクトルを採用している点も、運用コストの面で大きなメリットとなります。

なぜ埋め込みは1ベクトルでは不十分なのか——「pplx-embed-v2-late」の技術的革新

従来の高密度(dense)埋め込みモデルは、文書全体を1つのベクトルに圧縮します。これは情報のボトルネックを生み、検索時に「pasta」で検索しても文書中の「spaghetti」を正確にマッチングできないケースがありました。

pplx-embed-v2-lateが採用する「MaxSim(最大類似度)」スコアリングでは、文書内のトークンごとに128次元のベクトルを保持します。検索時は、クエリの各トークンが文書内の最も類似したトークンを見つけ出し、その最大値を合計することで文書全体のスコアを算出します。これにより、単語の同義語や言い換えに強い、柔軟な検索が実現します。

モデルは、18Bの教師モデルから、LEAFスタイルのトークンレベルの蒸留(distillation)によってトレーニングされています。軽量版と高品質版はこのプロセスで同一の埋め込み空間を共有しており、用途に応じてモデルを組み合わせる「非対称検索」が可能です。

2つのモデルサイズと推奨されるユースケース

指標 pplx-embed-v2-late-0.6B pplx-embed-v2-late-9B
総パラメータ数 594M 9B(公開ページでは8B表記)
アクティブパラメータ数 テキスト約240M、画像約340M 7.4B
ベースモデル Qwen3.5-0.8B(12層に刈り込み) Qwen3.5
出力ベクトル次元 トークンあたり128次元 トークンあたり128次元
推奨実行環境 ノートPC、エッジデバイス、小型GPU データセンター向けGPU
想定される役割 リアルタイムのクエリエンコーダ、ローカル運用 文書インデックスの構築

Perplexityは、0.6Bモデルを「軽量なクエリエンコーダ」として位置づけ、エッジデバイスでの動作も想定しています。重みのメモリ使用量は、bf16精度で約1.2GB(0.6B版)と推定され、実際の導入のしやすさが意識された設計となっています。

競合を凌駕——「MADQA」92.4%、Q2D-Webでも新記録

Perplexityが発表したベンチマーク結果(自己報告)によれば、9B版はエージェント型PDF検索のベンチマーク「MADQA」で92.4%を記録。Mixedbreadのretriever(88.9%)を上回り、検索機能としてトップクラスの精度を示しました。

もう一つの注目結果は、Perplexityの独自ベンチマーク「Q2D-Web(Recall@1000)」です。9B版が74.8%、0.6B版が73.6%を達成し、従来の最高記録である69.3%を大きく更新しました。これは、70,000クエリと1億9,000万のウェブ文書からなる大規模なデータセットでの評価であり、実用的なウェブ規模の検索における優位性を示しています。

一方で、画像検索ベンチマーク「ViDoRe v3」においては、9B版でも65.2%と、Tencentの「EVIE」に及ばない結果となっています。画像ドメインは依然として課題が残りますが、0.6B版はnemotron-colembed-v2-8bと1.2ポイント差に迫っており、軽量モデルとしてのコストパフォーマンスは極めて高いと言えます。

「非対称検索」の威力——9Bインデックス×0.6Bクエリで半額の品質

pplx-embed-v2-lateの最も革新的な運用方法は、「非対称検索」です。9Bモデルで構築した文書インデックスに対し、軽量な0.6Bモデルでクエリを実行する方式です。ViDoRe v3画像検索において、この非対称構成は63.5%を記録。0.6Bモデルをインデックスとクエリの両方に使った場合の62.3%を上回り、クエリの計算コストは同じでありながら品質が向上しました。Perplexityはこれを「テキスト検索において、9Bモデルから0.6Bモデルへの品質ギャップの約半分を、0.6Bのクエリコストで回復できる」と説明しています。

ホスティングとライセンス——完全セルフホスト型、APIは準備中

現在、両モデルはMITライセンスのもと、Hugging Faceで公開されています。商用利用を含む自由度の高い利用が可能で、自社のインフラにデプロイすることを前提としています。実行には、sentence-transformers >= 6.0.0およびtransformers >= 5.4.0が必要です。PerplexityのAPIエンドポイントも計画されていますが、現時点では提供されていません。ウェイトはF32形式で公開されていますが、運用時はbf16に変換してメモリ使用量を削減することが推奨されます。

注意すべき制約とトレードオフ

このモデルには、いくつかの明確な制約もあります。まず、トークンごとにベクトルを保存するため、文書が長くなるほどインデックスサイズが肥大化します。次に、単一の入力にテキストと画像を混在させることができません。また、すべてのベンチマークスコアは自己報告であり、技術報告書は未公開です。画像検索の分野では、Gemini Embedding 2がMIRACL-VisionやPPLX-Q2Iで9Bモデルを上回っており、画像ドメインが本モデルの弱点であることが明確です。

まとめ:RAGとエージェント検索の新たな基盤へ

pplx-embed-v2-lateは、PDFやスライド、スキャン文書を対象としたビジュアルドキュメント検索、低レイテンシ検索、そしてエージェント型RAGに最適なモデルです。トークンごとのベクトル保持によるストレージコストは、128次元というコンパクトさで補われています。Perplexityは、このモデルを検索エンジンの中核に据えることで、より高精度で文脈を理解した情報検索の実現を目指していると考えられます。今後のAPI公開や技術報告書の発表が待たれます。

この記事をシェア