ハードウェア初出 9/3 02:32
UE5M3 FP4ブロックスケーリングによる安定した言語モデル事前学習
UE5M3 FP4 Block Scaling for Stable Language Model Pretraining
https://export.arxiv.org/api/query2026/9/3
AI要約
FP4事前学習の安定化のためのUE5M3 FP4ブロックのスケーリング方法を提案する。より広い範囲のブロックスケールを使用し、選択的なスケーリングにより、現在のTensor Engineのオーバーヘッドなしで安定した学習を実現する。
AI要点
- FP4 (4ビット浮動小数点数) を用いた大規模言語モデルの事前学習における安定化手法を提案している。
- 従来のNVIDIAのTransformer Engineとは異なり、E5M3ブロックスケールと確率的丸めを組み合わせる「UE5M3 FP4ブロック スケーリング」手法を導入した。
- 提案手法により、Nemotron-H 8Bモデルを1900億トークン学習させ、従来手法より低い損失と高い下流タスク性能を達成した。
- RHT(ランダム化アダマール変換)を省略し、内部線形層にFP4を適用することで、スループットが21.2%向上した。
なぜ重要か
この研究は、FP4という低精度フォーマットでの大規模言語モデルの安定した事前学習を可能にする新たな手法を提案し、計算コストを抑えつつモデル性能を向上させる可能性を示唆しており、効率的なLLM開発に寄与します。