LLM推論2本の記事が同じ件を報じた初出 8/5 02:57
推論LLMにおけるテスト時スケーリング: 推論、評価、再現性
Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
https://export.arxiv.org/api/query2026/8/5
AI要約
Test-Time Scalingは、推論時に計算リソースを増やすことでLLMの推論能力を向上させる技術に関する研究である。単一軌跡の拡張、候補生成と集約、部分状態の探索など、多様なアルゴリズムが存在するが、それらの違いや計算量の評価、再現性について検討し、より統一的な理解と評価を目指す。
AI要点
- 推論能力を持つLLMにおいて、推論時の計算量(コンピュート)を増やすことで、より困難な問題も解決できる「テスト時スケーリング」という概念が提唱されている。
- テスト時スケーリングには、単一軌道の拡張、候補の集約、未完了状態の探索など、多様なアルゴリズムが存在する。
- これらのアルゴリズムは、単一の計算量予算で比較することが難しく、結果の再現性や比較可能性を損なう可能性がある。
- 本研究では、テスト時スケーリングを体系的に分析し、評価原則と再現性の要件を定義している。
なぜ重要か
LLMの推論能力を最大限に引き出すためのテスト時スケーリングの理解と標準化は、モデルの性能評価の信頼性を高め、より効率的で再現性の高いAI研究開発を促進する上で重要である。