シードデータ不要、タスク記述だけでAI学習データを生成する新機能登場

米Adaption Labsがリリースした「Invent a Dataset」は、タスク記述だけで構造化データセットを生成し、AI開発のデータ準備を劇的に効率化する。

投稿者 central
タスク記述からAI学習データを合成生成する新機能「Invent a Dataset」の仕組みと背景を解説。
ハイライト
  • Invent a Datasetはシードデータやスキーマ不要で、タスク記述のみから訓練データを生成する。
  • APIは1回の呼び出しで非同期生成を開始し、ステータスポーリングで結果を取得する。
  • 本機能は「振る舞いそのもの」からデータ生成を始める点が従来の合成データツールと決定的に異なる。

米国スタートアップのAdaption Labsは、AIモデルの学習データを合成生成する新機能「Invent a Dataset」を正式にリリースしました。本機能の最大の特徴は、「モデルにどのような振る舞いを学習させたいか」というタスクの記述を記入するだけで、構造化された訓練済みデータセットを生成できる点にあります。従来のワークフローでは必須とされてきたシードコーパスや事前定義されたスキーマ、ラベリングガイドが一切不要であることが、業界関係者の注目を集めています。

誕生の背景:データがモデルの品質を決める壁

従来、機械学習におけるデータセットの作成は「既存データ」から始めるのが一般的でした。チームはラベリング、フィルタリング、再整形に数週間から数カ月を費やし、データを目的のタスクに近づける作業を強いられてきました。Adaption Labsの研究チームは、このアプローチではモデルの品質が、あらかじめ手元にあるデータと目的の振る舞いとの一致度によって上限が決まってしまうと指摘します。

特に、企業固有の専門的なタスクにおいては、有用なシグナルが社内システムや非構造化テキスト、ワークフローログの中に点在しており、それらを直接的に訓練用データセットに変換することは困難でした。既存の合成データツールは、人間がスキーマやタスク分布、生成戦略を定義した後の工程を自動化するものですが、Invent a Datasetはその一歩手前、**「振る舞いそのもの」**からデータ生成を始める点が決定的に異なります。

「Invent a Dataset」の仕組み

APIのコアフロー:たった1回の呼び出しで

動作メカニズムは非常に具体的かつ実用的に設計されています。Python SDKまたはREST APIを通じて`datasets.invent`を1回呼び出すと、非同期でデータセットの生成が開始され、即座にステータス`running`が返されます。ユーザーは`datasets.get`でステータスをポーリングし、`succeeded`に変わった時点で結果をダウンロードする流れです。生成された行はJSONL、JSON、CSV、Parquet形式で入手可能で、ユーザーが完全に所有権を持つポータブルなファイルとして、どこでもトレーニングに使用できます。

ドメインコード:生成内容の質を左右する仕組み

生成されるデータの内容を制御する主要なパラメータが「ドメインコード」です。コードは`datasets.invent_domains`で動的に取得するため、ハードコーディングの必要はありません。例えば`medical`を指定し、さらに`medical.symptoms_diagnosis`のような修飾されたサブドメインコードで絞り込みを行うことが可能です。複数のドメインを同時に指定することもでき、サブドメインを指定しない場合は該当ドメインの全範囲からデータが生成されます。少なくとも1つのドメインまたはサブドメインが必須です。

二つの訓練フォーマット:SFTとDPOに対応

出力形式は二種類用意されています。デフォルトの`instruction_dataset`は、指示(プロンプト)と応答(コンプリーション)のペアを生成し、教師ありファインチューニング(SFT)に使用します。もう一つの`preference_pairs`は、選択された応答(chosen)と拒否された応答(rejected)のペアを生成し、DPO(Direct Preference Optimization)のような選好ベースの学習に対応します。

実運用で重要な3つのパラメータ

プロダクション環境での利用を想定した場合、以下の3つのパラメータが特に重要です。

  • estimate=True: 実際にデータセットを作成・課金することなく、リクエストの正確な価格と利用可能なクレジットを確認できる機能です。
  • prompt: 最大10,000文字まで受け付け、生成される行の内容を具体的に指示するために使用します。これにより、単なるドメイン指定以上の細かいニュアンスをデータに反映できます。
  • idempotency_key: 最大255文字の一意キーを指定することで、ネットワーク障害などによるリトライを安全に行えます。同じキーでの重複リクエストは、新規に生成を起動するのではなく、元のデータセットを返します。

言語・ロケール拡張:グローバル対応の現実解

グローバル展開を視野に入れた場合、多言語対応は避けて通れません。Invent a Datasetの`language_expansion`機能は、この課題に対して実用的な二つのモードを提供します。

translateモードは、指定された各ターゲット言語に対して、生成された行の翻訳バリアントを新規に作成します。localizeモードは、単なる翻訳ではなく、国と言語のペアごとにロケール固有の表現を使用したバリアントを生成します。これにより、単なる機械翻訳ではなく、現地の文化や慣習に配慮したデータセットが可能になります。

`sample_rate`(0.01から1の範囲)は、生成された行のうち何割を拡張対象とするかを制御します。クレジットの課金はオリジナルの行数ではなく、拡張後の出力行数に対して行われます。サポートされていないコードを指定すると、有効な値のサンプルとともに400エラーが返ります。

ゼロデータループ:AutoScientistとの統合

Invent a Datasetの真価は、単なるデータ生成ツールとしてではなく、**「インテント(意図)から学習済みモデルへのループ」**の第一段階として位置づけられている点にあります。

生成されたデータセットのIDは、そのまま同社のトレーニング最適化システム**AutoScientist**(2026年5月ローンチ)の`autoscientist.create`に渡すことができます。AutoScientistは、Adaptive Dataの対となる存在であり、データとトレーニングレシピをユーザーの目的に対して共同最適化します。

同社の内部評価によると、AutoScientistは自社の研究スタッフが手動で設定したトレーニング構成と比較して、平均**35%**のパフォーマンス向上を達成。勝率は**48%から64%**に向上したと報告されています。これらの数字は、8つの異なる垂直領域における社内ドメイン特化評価に基づいており、データセットサイズは5,000行から100,000行、アーキテクチャはTogether AIが提供するファインチューニング用のものが使用されました。

考察:なぜこのアプローチが業界のゲームチェンジャーたりえるのか

Invent a Datasetの登場は、AIモデル開発におけるパラダイムシフトの一つと言えるでしょう。従来の合成データツールが「ラベルの付いたデータ」を生成するのに対し、本機能は「特定の振る舞い方を学習させるためのデータ」を生成します。この違いは、API設計にも明確に現れています。

もちろん、制約も存在します。生成処理は現在、Adaptionがホストするプラットフォーム上で実行され、クレジットを消費します。セルフホストによる生成パスは現時点では提供されておらず、大規模かつ定常的なデータ生成パイプラインとして運用するには、コスト設計とスケーラビリティの検証が別途必要でしょう。

しかし、データサイエンティストが「こういうデータがあればモデルがもっと賢くなるのに」と考えた瞬間に、それをコード化して実行に移せるという体験は、特に日本のスタートアップや研究機関にとって、プロトタイピングの速度を劇的に向上させる可能性を秘めています。

シードデータすら存在しないゼロからのプロジェクトであっても、この機能を使えば、数時間のうちに高品質な教師データを生成し、モデルのトレーニングに着手できます。これは、AI開発における「データの民主化」をさらに一歩進めるものであり、今後のエコシステムへの影響が注目されます。

この記事をシェア