LLM推論重要度 ★9
オフライン強化学習における周辺化重要度重み付けのためのBellmanキャリブレーション
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
https://export.arxiv.org/api/query·2026/8/25
AI要約
オフライン強化学習における重要度サンプリングの残差を、Bellmanキャリブレーションを用いて削減する手法を提案。既存手法の関数近似や不完全な最適化に起因する問題を特定し、より正確な方策評価を実現する。
AI要点
- オフライン強化学習において、周辺化重要度重み付け(Marginalized Importance Weighting)の推定誤差を低減する手法を提案している。
- 既存手法では、関数近似などにより真の分布からの逸脱(Residual Occupancy-Balance Violations)が発生していた。
- 提案手法「Isotonic Bellman Calibration」は、推定されたオキュパンシー比を単調変換により後処理することで誤差を補正する。
- この手法は、モデルに依存せず、ハイパーパラメータチューニングやモデル選択にも活用できる。
- キャリブレーション誤差が小さいほど、下流のタスク(方策価値推定など)の性能が保証される。
なぜ重要か
提案手法は、オフライン強化学習における重要度重み付け推定の精度を向上させ、限られたデータからでも信頼性の高い方策を学習可能にすることで、実応用への展開を促進する。