LLM推論重要度 ★10
ランダム化YaRNが長文脈推論の長さ一般化を改善
Randomized YaRN Improves Length Generalization for Long-Context Reasoning
https://export.arxiv.org/api/query·2026/6/22
AI要約
長文脈の推論能力を向上させるため、YaRN位置エンコーディングとランダム化位置エンコーディング、および長さカリキュラムを組み合わせた学習手法。長シーケンスへの汎化能力を改善する。
AI要点
- 長文脈の推論タスクにおいて、LLMが長すぎるコンテキストの一般化に依然として課題を抱えている。
- 「Randomized YaRN」という新しいトレーニング手法が提案され、長文脈の一般化能力を改善する。
- この手法は、YaRNベースのポジショナル外挿とランダム化された位置エンコーディング、および長さカリキュラムを組み合わせる。
- BABILongやMRCRなどのベンチマークで、8Kコンテキスト未満でのトレーニングで128Kまでのコンテキスト長での性能向上が確認された。
なぜ重要か
長文脈を正確に理解・処理するLLMの能力向上は、文書要約、質疑応答、コード生成など、より複雑で実用的な応用を可能にする。Randomized YaRNは、LLMがより長いコンテキストに対応できるようになるための有効なアプローチを提供する。