LLM推論初出 7/30 02:59
オンラインRLファインチューニングにQ関数を事前学習する必要は本当にあるか?
Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
https://export.arxiv.org/api/query2026/7/30
AI要約
オンライン強化学習のファインチューニングにおいて、Q関数の事前学習が本当に必要かを検証。従来の常識に反し、ランダム初期化されたQ関数でも高性能かつ信頼性の高いポリシー学習が可能であることを示唆。
AI要点
- オンライン強化学習(RL)のファインチューニングにおいて、Q関数の事前学習が本当に必要かを体系的に調査した。
- 驚くべきことに、単純なQ関数事前学習は、ランダム初期化と比較してほとんど利点がないことが判明した。
- これは、事前学習で学習されたQ関数が、ファインチューニングで収束するQ関数とはターゲットが異なるためである。
- この問題を解決するため、複数の多様なポリシーのロールアウトを利用してQ関数学習をブートストラップするIPE(Initialization via Policy Ensemble)を提案する。
- IPEは、困難な連続制御ベンチマークにおいて、単純なQ関数事前学習と比較して平均1.26倍のファインチューニング性能向上をもたらした。
なぜ重要か
IPEは、Q関数の事前学習の必要性を低減し、オンラインRLのファインチューニングプロセスを効率化・高性能化する新たな手法を提供し、より迅速なポリシー学習を可能にする。