LLM推論初出 8/28 02:58
TTPO:テスト時ポリシー最適化
TTPO: Test-Time Policy Optimization
https://export.arxiv.org/api/query2026/8/28
AI要約
TTPOは、テスト時訓練(TTT)を可能にするテスト時ポリシー最適化手法である。従来の多数決疑似ラベルに頼る方法の脆弱性を克服し、モデルの誤りをより効率的に検出し、数学的推論能力の向上を目指す。
AI要点
- テスト時学習(TTT)が可能な数理推論のための新しい教師なし学習手法「TTPO」を提案。
- 疑似ラベルの誤りに頑健な、非対称な目的関数を設計。
- 合意したロールアウトは蒸留し、不一致のロールアウトはペナルティを与える。
- トークンレベルでの選択により、収束した位置の蒸留を重み付けし、確信度の高い誤りをペナルティ。
- ラベルなしで、教師あり手法と同等の性能を達成し、Qwen3-1.7Bモデルの精度を向上。
なぜ重要か
TTPOは、ラベルなしでLLMの数理推論能力をテスト時に最適化する手法であり、追加のラベル付けコストなしにモデル性能を向上させることで、LLMの応用範囲を広げる可能性を秘めています。