LLM推論初出 8/9 17:39
DeepSeek V4 Flash 0731、独立した公開ハーネス実行(445回の試行)でTerminal-Bench 2.1で82.7%を達成
DeepSeek V4 Flash 0731 hits 82.7% on Terminal-Bench 2.1 in an independent public-harness run (445 trials)
https://www.reddit.com/r/LocalLLaMA/.rss2026/8/9
AI要約
DeepSeek V4 Flash 0731モデルのベンチマーク結果について、独立した公開ハーネスを用いた検証結果を報告しています。DeepSeekは未公開のハーネスで高いスコアを主張しましたが、公開ハーネスではそれに匹敵する結果が得られました。
AI要点
- DeepSeek V4 Flash 0731モデルが公開ハーネス実行でTerminal-Bench 2.1にて82.7%を達成した。
- 独立した公開ハーネスでの検証結果が報告されている。
- 未公開ハーネスでの高いスコア主張に対し、公開ハーネスで同等の結果が得られたと説明されている。
なぜ重要か
モデルの性能評価における客観性と再現性が重要視される中、公開ハーネスでの検証結果は、モデルの真の実力を示す指標として客観的な評価を可能にします。