LandingAIは現地時間2026年6月、文書インテリジェンススタックを全面的に刷新した新世代の文書抽出AI「Agentic Document Extraction (ADE) Gen2」を正式公開した。従来のGen1が文書をフラットなチャンク(断片)のリストとして処理していたのに対し、Gen2はこれをツリー構造として扱い、課金体系をページ単位から出力文字数単位に変更。加えて、回答の根拠をページ上の特定の行や単語レベルで提示する「アトミックグラウンディング」を実装した点が最大の特徴である。同社は今回のリリースを「 affordability(手頃な価格)」「agent ready outputs(エージェント対応出力)」「atomic grounding(原子レベルの根拠付け)」の3つのテーマで構成すると説明している。
2つのパースモデルで用途に応じた課金を実現
ADE Gen2の核心は、新たに開発されたモデルファミリー「DPT-3」である。最も重要な変更点の一つが、パース(解析)処理を2つのモデルに分割したことだ。これにより、ワークロードの性質に応じて最適なコストで処理が行えるようになった。
まず「DPT-3 Verity」は、デジタル作成された文書を決定論的に文字起こしし、すべての単語にバウンディングボックスと信頼度スコアを付与する。大量のテキストやテーブル、シンプルなフォームフィールドを高速処理する用途に設計されている。一方の「DPT-3 Pro」は、ページのレイアウトを単語よりも先に読み取り、テーブルや図から欄外注釈、署名に至るまでブロックタイプを検出し、それらを読む順序で返す。スキャン文書や手書き文字、非ラテン文字、LaTeX形式の数式にも対応する。
課金面では、VerityはProの約40%のクレジット消費で済むと同社は説明している。将来的には、2026年秋に両モデルを自動ルーティングする機能の実装も計画されている。
課金体系刷新のインパクト——ページ課金から文字数課金へ
価格体系の変更は、今回のリリースにおいて最も注目すべき実務的インパクトを持つ。従来のDPT-2では、1ページあたり一律3クレジットが課金されていた。DPT-3では、クレジット消費が「ページコンポーネント」と「出力文字コンポーネント」の合計となる。
Priority(優先)ティアの場合、Proは1ページあたり1クレジットに加え、出力1,000文字あたり0.5クレジットが加算される。Verityはページあたり0.3クレジット、1,000文字あたり0.2クレジットである。Standard(標準)ティアでは、両方のレートが半額になる。例えば、12ページのドキュメントをProでパースし、出力文字数が48,120文字だった場合、Priorityでは合計36.1クレジット、Standardではその約半額となる。計算の端数は0.1クレジット単位で切り上げられ、レスポンスのメタデータには計算に使われたすべての入力値が報告される。
PriorityはユーザーまたはAIエージェントが待機しているリアルタイム処理向けで、Standardは非同期処理として動作し、パイプライン処理に適している。ただし、同期呼び出しは常にPriority課金となる点は注意が必要だ。LandingAIは、混合ワークロードで従来比25%から80%のコスト削減を見込み、VerityとStandardの組み合わせでは1ページあたり1セント未満でのパースも可能と主張する。ただし、文字数コンポーネントの導入により、文字密度の高いページは以前よりコストが増加する可能性もあるため、実際のコストは自社の文書構成でベンチマークを取ることが推奨される。
「チャンク」から「ブロック」へ——階層構造の採用
ADE Gen2の技術的な要となるのが、レスポンス構造の再設計である。新たな「Parse v2」レスポンスは、3つのトップレベルフィールド——読む順序に従ったmarkdown、metadata、そしてstructure——で構成される。
structureはドキュメントノードをルートとし、その子要素がページ、さらにその子要素がブロックという階層構造を取る。ブロックタイプには、text(テキスト)、table(表)、table_cell(セル)、figure(図)、marginalia(欄外注釈)、attestation(証明印)、logo(ロゴ)、card(カード)、scan_code(スキャンコード)などが含まれる。すべてのブロックは、type-index形式のセマンティックIDを持ち、ページ番号、markdown文字列内の範囲、正規化されたバウンディングボックスを含むグラウンディングオブジェクトが付与される。
Markdown出力も標準化が図られている。図は<figure type="CHART"/>code形式の要素で表現され、機械が生成した説明文は<description/>codeタグ内に隔離されるため、文字起こし結果とモデルによる解説が誤認されるリスクが排除される。証明印は[STAMPED][SIGNED]のようにラベルが積み重ねられ、[ILLEGIBLE_SIGNATURE]や[ILLEGIBLE_TEXT]は固定リテラルとして扱われる。テーブルはデフォルトでHTML形式で出力され、セルの結合状態が保持される。
アトミックグラウンディングがもたらす精度と応用可能性
ADE Gen2の最も先進的な機能が「アトミックグラウンディング」である。すべてのリーフブロックにはatomic_grounding配列が付与され、Proの場合は視覚的な行ごとに1エントリ、Verityの場合は単語ごとに1エントリが作成される。Verityでは単語ごとに0から1の信頼度が付与され、これはその単語を構成する文字スコアの最低値として計算される。この仕組みにより、信頼度の低い文字起こしをレビューに回すといったワークフローが構築可能になる。
さらに、テーブルセルには個別のバウンディングボックスが割り当てられる。Extract V2では、このグラウンディングから引用情報が生成されるため、抽出されたフィールドは特定のページ上の特定の単語までトレースできる。これにより、座標ベースのPII(個人識別情報)のリダクションや文書の差分比較、レビューアー向けユーザーインターフェースの構築が、従来の近似ベースから正確な位置ベースへと移行することを意味する。
導入環境と運用の柔軟性
ADE Gen2は本日より一般提供が開始されている。開発者はADE Playgroundで無料から利用を開始でき、エンタープライズユーザーは米国またはEUのクラウド、AWS・Azure・Google Cloud上の自社VPC、Snowflake内部、さらにはエアギャップ環境を含むオンプレミスまで、幅広いデプロイオプションから選択できる。非同期のParse Jobsは、1PDFあたり最大6,000ページまたは1GBまで対応し、Webhook通知にも対応する。なお、Ground APIはクレジット消費ゼロで利用可能な無料APIとして提供される。
実運用への影響と評価のポイント
Gen1からGen2への移行は、ParseおよびExtractエンドポイントの互換性がなく、コードの修正が必要となる破壊的変更である。一方、Extract V1で構築されたスキーマはV2に引き継がれるため、抽出ルールの再設計は不要である。LandingAIの発表はベンダーの主張として捉えるのが妥当だが、ページ単位の一律課金から文字数とモデル選択に基づく課金への移行は、特に高密度文書や大量処理を行うエンタープライズにとって、コスト構造を根本的に見直す契機となる。日本語文書のような文字数の多い言語での実コストは、実際の文書サンプルを用いた検証が不可欠である。