LLM推論初出 9/9 02:59
長さ外挿可能なリカレントモデルの学習
Learning Length-Extrapolatable Recurrent Models
https://export.arxiv.org/api/query2026/9/9
AI要約
この論文は、リカレントモデルが長いコンテキストを扱うための自然な方法を提供するが、BPTTで訓練されたモデルは訓練範囲を超えると失敗することが多いという問題に取り組む。勾配消失・爆発だけでなく、状態クレジットの重要性を研究し、学習失敗の原因を特定する新たな視点を提供する。
AI要点
- リカレントモデルが訓練範囲を超えて性能を維持する「長さ外挿性」を学習する手法CSTを提案。
- CSTは、勾配降下法における状態クレジット信号を安定化させる。
- 訓練データとは異なる長さの系列に対しても、性能が向上することを示した。
- 最長で訓練長の128倍の系列長まで性能が改善されることを確認した。
なぜ重要か
この手法は、リカレントニューラルネットワークの長期系列処理能力を大幅に向上させ、自然言語処理や時系列予測などの分野で、より長いコンテキストを扱えるモデル開発に貢献します。