エージェント初出 8/1 19:00
AIの報告は12件に1件しか当たらない — コードが読めない人間が株botを2,758コミット書かせた記録
https://zenn.dev/topics/ai/feed2026/8/1
AI要約
AIに株の自動売買botを2,758コミット書かせた記録。AIの報告の正確性に疑問符がつき、12件に1件しか当たらないという結果に。コードが読めない人間がAIに指示を出す際の課題と、AIの報告の信頼性について検証している。
AI要点
- コードが読めない人間がAIに株の自動売買botを2,758コミット書かせた記録が紹介されています。
- AIからの報告の約60件中、実際にバグであったのは5件(約12件に1件)だったと報告されています。
- AIの誤検知は、エージェントが見たファイル範囲が狭いために生じる、推論は正しいが全体で見ると間違いになるケースが多いことが分析されています。
- AIの指摘を検証するAIを別に用意する、または「別のファイルに実装がないか調べ直せ」といった指示が有効だったことが示唆されています。
なぜ重要か
AIが生成するコードの正確性を保証するための検証コストが、生成コストに比べて相対的に非常に高く、AIの提案を鵜呑みにすることのリスクを示唆しているためです。