LLM推論初出 6/5 02:56
RREDCoT: 推論モデルのためのセグメントレベル報酬再配分
RREDCoT: Segment-Level Reward Redistribution for Reasoning Models
https://export.arxiv.org/api/query2026/6/5
AI要約
RREDCoTは、推論モデルのためのセグメントレベル報酬再配分手法。遅延報酬問題であるCoT推論において、GRPOなどのモンテカルロ手法の効率を改善し、報酬の割り当てを最適化する。