LLM推論初出 8/6 02:57
スキルネイティブLLMへ:長期間推論のベンチマークとトレーニングのためのスキルエントロピー
Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
https://export.arxiv.org/api/query·2026/8/5
AI要約
Skill Entropyは、LLMが複数の推論スキルを切り替える能力を評価・訓練するための指標です。長期的推論におけるスキル転換の課題に取り組みます。
AI要点
- 長期間推論タスクにおける「スキル切り替え」の難しさを測る指標として「スキルエントロピー」を提案した。
- 558個のスキルを横断する長期間推論ベンチマーク「Skill^2-Bench」を構築し、モデルのスキル切り替え能力を評価した。
- スキルエントロピーを再帰型ニューラルネットワークの学習シグナルとして利用する「Skill-Entropy RL」フレームワークを提案した。
- 提案手法により、Qwen3モデルのスキル切り替え能力が大幅に向上し、ベンチマークスコアが向上した。
なぜ重要か
LLMの長期間推論能力向上において、単一スキルの性能だけでなく、異なるスキル間を効率的に切り替える能力が重要であることを示した。スキルエントロピーは、このスキル切り替え能力の評価と改善に貢献する新しい指標である。