LLM推論初出 8/11 02:41
大規模言語モデルにおける数学的汎化のためのFusion Training
Fusion Training for Mathematical Generalization in Large Language Models
https://export.arxiv.org/api/query2026/8/11
AI要約
LLMの数学的汎化能力向上のため、思考モードと非思考モードの融合訓練(TMF)におけるデータ比率と学習スケジュールを体系的に研究する。
AI要点
- 「Fusion Training」は、LLMが簡潔な応答と長文の推論の両方をサポートできるようにする「Thinking Mode Fusion (TMF)」の訓練ダイナミクスを研究する。
- TMFにおける「データ比率」と「訓練スケジュール」が、思考モード(Thinking Mode)と非思考モード(Non-thinking Mode)の相互作用に与える影響を分析した。
- 数学的問題解決に焦点を当てたベンチマークで実験した結果、非思考モードの監督を増やすと、思考モードの精度が低下するという非対称な相互作用が明らかになった。
- 異なる訓練スケジュールがこのトレードオフを調整し、最適なスケジュールはデータ比率に依存することが示された。
- 非思考モードと思考モードの監督の間には、本質的な緊張関係が存在することが定量化された。
なぜ重要か
Fusion Trainingの研究は、LLMが数学的問題解決のような複雑なタスクにおいて、推論能力と応答速度のバランスを最適化するための効果的な訓練設定に関する実用的な指針を提供し、LLMの汎用性を高めることに貢献する。