ハードウェア重要度 ★9
1ステップの勾配遅延は、大規模非同期パイプライン並列LLM事前学習の障壁とならない
One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining
https://export.arxiv.org/api/query·2026/6/29
AI要約
大規模非同期パイプライン並列LLM事前学習における、1ステップ勾配遅延の問題を解決。PipeDream-2BW スケジュールにより、GPUアイドル時間を排除し、スループットを最大化する。
AI要点
- 大規模LLM事前学習において、非同期パイプライン並列処理の勾配遅延問題は解決可能であることが示された。
- 最適化手法の選択が勾配遅延の影響を大きく左右し、AdamWでは性能低下が見られるがMuonは頑健性を示した。
- 勾配遅延の影響を軽減するエラーフィードバック着想の補正手法が提案され、理論的にも収束が証明された。
- 提案手法により、同期学習との性能差が縮まり、大規模非同期パイプライン並列学習の実用性が示された。
なぜ重要か
大規模LLMの事前学習における計算資源の無駄を削減する非同期パイプライン並列処理の有効性を示し、より効率的な大規模モデル開発への道を開く可能性があるため。