LLM推論初出 6/9 02:58LLM RLにおける発散正則化の再考Rethinking the Divergence Regularization in LLM RLhttps://export.arxiv.org/api/query2026/6/9 お気に入り 後で読む 既読にする 元記事を読む AI要約LLMのRLにおけるオフポリシー学習の安定化に不可欠な信頼領域制御について、PPOやGRPOのクリッピング機構が長尾分布で不十分である点を指摘し、代替手法を検討。#arxiv#LLM推論ShareB! はてブ𝕏 ポストLINE リンク