LLM推論重要度 ★9
コード生成におけるテスト時強化学習のためのエントロピー正則化ランクマスク付きポリシー最適化
Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
https://export.arxiv.org/api/query·2026/9/8
AI要約
コード生成におけるテスト時強化学習(TTRL)のための、エントロピー正則化されたランクマスクド方策最適化手法を提案する。従来のTTRLはコード生成の課題には直接適用できないため、問題文からプローブ入力を生成し、候補プログラムを実行して報酬を導出する新たなアプローチを開発した。
AI要点
- コード生成におけるテスト時強化学習(TTRL)のため、エントロピー正則化ランクマスク付きポリシー最適化(ERPO)を提案。
- 従来のTTRLはコード生成には不向きなため、「Probe-driven TTRL」を考案し、Probe Consensus Reward (PCR)を導入。
- PCRは信頼性が低く報酬ハッキングの可能性があるため、ERPOはランクマスクで負の更新を制御し、エントロピー上限でポリシーのドリフトを抑制。
- ERPOは、in-domain適応とゼロショット転移の両方で、pass@1およびpass@k性能を大幅に向上。
- 提案手法は、EMNLP 2026メインカンファレンスに採択された。
なぜ重要か
コード生成タスクにおけるテスト時強化学習の課題を解決するERPO手法は、AIによるコード生成の精度と信頼性を向上させ、ソフトウェア開発の効率化に貢献する可能性がある。