LLM推論初出 7/9 02:49
拡散モデルRLHFのためのサンプル効率的な選択的タイムステップ重み付けとアドバンテージベースリプレイ
Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
https://export.arxiv.org/api/query2026/7/9
AI要約
拡散モデルのRLHFはフィードバック効率が低い。既存手法は大量の評価を必要とし、実用的ではない。本研究では、選択的タイムステップ重み付けとアドバンテージベースリプレイにより、拡散RLHFのサンプル効率を向上させる。
AI要点
- 拡散モデルのRLHF(人間からのフィードバックによる強化学習)におけるサンプル効率を向上させる手法を提案。
- 選択的タイムステップ重み付けとアドバンテージベースリプレイを導入。
- 既存手法が大量の評価を必要とする実用上の課題を解決することを目指す。
- より少ないデータで拡散モデルの性能を向上させることを可能にする。
なぜ重要か
拡散モデルのRLHFにおけるサンプル効率を改善することで、大規模言語モデルなどの開発コストを削減し、より迅速な高性能AIモデルの展開を促進する。