LLM推論初出 5/22 02:59
Vector Policy Optimization: Diversityのためのトレーニングがテスト時の検索を改善
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
https://export.arxiv.org/api/query2026/5/22
AI要約
Vector Policy Optimizationは、LLMが多様なタスクや推論プロセスに対応できるようにするための新しい学習パラダイムです。単一の報酬ではなく、複数の報酬ベクトルを最適化することで、LLMの応答の多様性を高めます。