研究/論文初出 6/5 01:18
DeepSWEベンチマークが無能な実行方法で実施され、結果は完全に無効である
The DeepSWE benchmark was runned rather incompetently and the results are completely invalid
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/5
AI要約
DeepSWEベンチマークの実施方法とその結果の妥当性に対する批判。ベンチマークの信頼性や評価手法の重要性を示唆しており、AIモデルの性能評価における課題を提起している。