ビジネス応用重要度 ★9
静的から動的へ:MCR-Benchを用いた実世界コードレビューのベンチマーキング
From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench
https://export.arxiv.org/api/query·2026/8/27
AI要約
MCR-Benchは、現実世界のコードレビューの反復的かつインタラクティブな性質を捉えるためのベンチマークである。従来の単回静的タスクとしてコードレビューを単純化するアプローチとは異なり、LLMを用いた現実的なコードレビューの評価を可能にする。
AI要点
- 現実世界での複数ラウンドにわたるコードレビューをベンチマークするための「MCR-Bench」を提案。
- MCR-Benchは5つのプログラミング言語に対応し、2,269件の実世界のコードレビュータスクを含む。
- 各タスクには、欠陥のメタデータとラウンド間の状態ラベルが付与されており、欠陥の進化軌跡を追跡可能。
- LLMを用いた実験では、LLMの全体的な能力は限定的で、ラウンド数が増えると性能が低下。
- 欠陥の種類や深刻度によってLLMの性能が変動し、時間的ずれや記憶不足が弱点であると分析。
なぜ重要か
現実的な複数ラウンドのコードレビュープロセスを再現したベンチマークMCR-Benchを構築することで、LLMを用いたコードレビューシステムの性能評価と改善を促進し、ソフトウェア開発の効率化と品質向上に貢献します。