LLM推論初出 7/28 02:54
DataOrchestra: 事前学習データの例ごとのキュレーションを学習する
DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
https://export.arxiv.org/api/query·2026/7/27
AI要約
LLMの事前学習データ処理における、例ごとのキュレーションを自動化するDataOrchestraフレームワークを提案。固定戦略ではなく、各データ例のニーズに合わせて処理パイプラインを動的にオーケストレーションすることで、データ処理の効率と効果を最大化する。
AI要点
- 大規模言語モデル(LLM)の事前学習データ処理において、データセット全体に単一の戦略を適用するのではなく、個々のデータ例に合わせた処理を行うフレームワーク「DataOrchestra」を提案。
- DataOrchestraは、データ例ごとに処理をドロップ、維持、またはクリーニングするかを決定し、クリーニングが必要な場合はLLMベースのリライトなどの操作を選択・指示する。
- DataOrchestraで処理したデータで事前学習したモデルは、既存の個別のデータ処理手法よりも一貫して高い性能を示した。
- Webデータおよび数学の継続事前学習において、計算コストを削減しながら性能向上を実現した。
なぜ重要か
LLMの性能に不可欠な事前学習データの質を、個々のデータ例の特性に合わせて最適化する新しいアプローチを提供し、モデルの学習効率と性能を向上させるため重要です。