エージェント初出 6/25 02:59
RevengeBench:行動実験からコード空間ポリシーをリバースエンジニアリング
RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments
https://export.arxiv.org/api/query2026/6/25
AI要約
エージェントの行動履歴のみから、その意思決定プログラムをコードとして復元する手法を提案。さらに、介入による実験設計能力が、この復元精度をどの程度向上させるかを検証する。
AI要点
- エージェントの行動履歴のみから、その意思決定プログラムをコードとして復元する手法「RevengeBench」が提案された。
- 介入による実験設計能力が、この復元精度をどの程度向上させるかを検証する。
- エージェントの行動からその内部ロジックを推測することが可能になる。
- AIエージェントの解釈可能性向上に貢献する。
なぜ重要か
エージェントの観測可能な行動履歴から、その行動を生成したコード(ポリシー)をリバースエンジニアリングする手法を提供し、AIエージェントの理解とデバッグを容易にする。