LLM推論2本の記事が同じ件を報じた初出 7/22 02:59
コピーを減らし、グラウンドを増やす:証拠認識型強化学習による長文脈推論における反復コピーの克服
Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
https://export.arxiv.org/api/query·2026/7/21
AI要約
長文コンテキスト推論において、入力テキストの繰り返しコピーを防ぐための、証拠認識型強化学習を用いた新しい手法を提案。長文LLMにおける重要な問題点を特定し、その軽減策を示す。
AI要点
- 長文脈LLMにおける「反復コピー」問題を特定し、その原因が不十分な根拠付けにあることを示した。
- 「GEAR(Grounding Evidence-Aware Reward)」という報酬整形手法を提案した。
- GEARは、関連証拠との重複に報酬を与え、無関係な文脈との重複に罰を与える。
- 自動化されたデータ構築パイプラインにより、GEARの学習データを生成可能にした。
- GEARは、長文脈タスクで標準的なRLより性能を向上させ、反復コピーを削減した。
なぜ重要か
長文脈LLMが長文や複雑な推論タスクで反復コピーを起こす問題に対し、根拠付けを強化するGEAR手法を提案し、より正確で効率的な推論能力の向上に貢献する。