LLM推論初出 9/5 18:58
【最新モデル】Claude Code / Codex / Cursor のコードレビューをOWASP Benchmarkで検証
https://zenn.dev/topics/ai/feed2026/9/5
AI要約
Claude Code、Codex、Cursorのコードレビュー機能をOWASP Benchmarkで検証。最新モデル(Opus 5, Fable 5.1, GPT-5.6, GPT-6)とCursorを対象に、脆弱性検出能力を評価し、前回の結果と比較・分析。
AI要点
- Claude Code、Codex、Cursorのコードレビュー機能をOWASP Benchmarkデータセットで検証した。
- 脆弱性検知精度は、Claude Code (Opus 5 / Fable 5.1) と Codex (/review) が満点近くで上位に並んだ。
- 精度の差は縮小しており、選定基準は「どこで動くか」「時間」「費用」「得意不得意」になる。
- Claude Codeの/security-reviewは誤検知ゼロだが、確信度で足切りするため「指摘なし」=「安全」ではない。
- リポジトリ全体スキャン機能は時間がかかるため、定期実行向けであり、push前の差分確認には向かない。
なぜ重要か
主要AIコードレビューツールの脆弱性検知能力を客観的データで比較検証した結果、ツールの使い分けや導入戦略策定のための具体的な指針を提供し、開発チームのセキュリティリスク低減と効率的なツール選定に貢献する。