LLM推論初出 7/3 02:58
DemoPSD: 不一致変調ポリシー自己蒸留
DemoPSD: Disagreement-Modulated Policy Self-Distillation
https://export.arxiv.org/api/query2026/7/3
AI要約
オンポリシー自己蒸留(OPSD)における教師モデルの密なトークンレベル教師信号が過学習や汎化性能低下を招く問題に対し、「DemoPSD」を提案。不一致変調(Disagreement-Modulated)により、より堅牢で汎用的な推論能力の獲得を目指す。
AI要点
- オンポリシー自己蒸留(OPSD)における教師モデルの過学習問題を解決する「DemoPSD」を提案。
- DemoPSDは、不一致変調ポリシー(Disagreement-Modulated Policy)を採用している。
- これにより、教師信号の密さによる過学習や汎化性能低下を防ぐことを目指す。
- より堅牢で汎用的な推論能力を持つモデルの実現が期待される手法である。
なぜ重要か
DemoPSDの提案は、自己蒸留における過学習問題を克服し、より汎用性の高いAIモデルの開発を可能にすることで、様々なタスクへのAI応用範囲を拡大する。