LLM推論初出 7/31 02:57
OSReward:クロスプラットフォームコンピューター利用報酬モデルのための標準化された評価の導入
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
https://export.arxiv.org/api/query2026/7/31
AI要約
コンピュータ利用エージェント(CUA)の評価には、タスク指示を満たしたかの検証が不可欠です。人間による検証はスケーラブルでないため、VLMが評価者として利用されます。本研究では、クロスプラットフォームなCUA評価のための標準化された評価方法であるOSRewardを提案します。
AI要点
- クロスプラットフォームコンピューター利用エージェント(CUA)の評価のための標準化されたベンチマークOSRewardを導入。
- OSRewardは、人間が検証した指示とグランドトゥルースの検証結果を持つCUA軌跡データセット。
- 既存のVision-Language Model(VLM)評価では、系統的な甘さのバイアスがあり、失敗例を成功と誤判定する傾向があることを発見。
- OSRewardに基づき、低コストで信頼性の高い報酬モデルOS-Shepherdを開発・公開。
なぜ重要か
OSRewardは、CUA評価におけるVLMの信頼性問題を体系的に明らかにし、より正確で効率的な評価を可能にする標準化されたベンチマークと、低コストな報酬モデルを提供する。