エージェント初出 8/13 02:53
再分配ベースのコスト推論がSparse Safe Offline RLを改善
Redistribution-based Cost Inference Improves Sparse Safe Offline RL
https://export.arxiv.org/api/query2026/8/13
AI要約
安全なオフライン強化学習では、通常、密なコストアノテーションが必要ですが、実際には軌道レベルの停止フィードバックしか得られません。この問題を解決するため、疎な停止フィードバックを密なコストに変換する「RCI」フレームワークを提案します。
AI要点
- Sparse Safe Offline RLの課題である、不足したコスト注釈を、軌跡レベルの停止フィードバックから密なコストへ変換するRCIフレームワークを提案。
- RCIは、リターン分解を用いたコスト推定により、密なコスト注釈がない状況でも安全なオフライン強化学習を可能にする。
- 提案手法は、CMDPにおける実行可能方策集合と最適ラグランジュを保存し、理論的にも損失がないことを示す。
- 実験では、従来手法と比較して大幅に低い違反率を達成し、異種データセット構成やラベルノイズに対する頑健性を示した。
なぜ重要か
安全なオフライン強化学習において、通常必要とされる密なコスト注釈なしで、稀なフィードバックから密なコストを推定する新しいアプローチを提供し、実用性を向上させます。