研究/論文初出 6/28 09:10
55のLLMをブラインド採点させた(22kの評価、すべて公開)。十分なデータを持つすべてのモデルファミリーは、そのファミリーのモデルに偏る傾向がある。Qwenは自身のモデルを約0.9ポイント優遇する。Mistralは自身のモデルを約1.0ポイント低く評価する。
I had 55 LLMs blind-grade each other (22k judgments, all open). Every model family with enough data is biased toward its own siblings. Qwen judges favor Qwen by ~0.9 points. Mistral penalizes its own by ~1.0.
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/28
AI要約
55のLLMに互いを評価させた結果、同系統モデルに評価バイアスが見られたという研究報告。多数のモデルを客観的に評価する手法と、その意外な発見はAI研究の重要な示唆。
AI要点
- 55のLLMを対象としたブラインド評価の結果、同系統のモデル同士で評価に偏りが見られた。
- Qwenモデルは自身のモデルを約0.9ポイント高く、Mistralモデルは約1.0ポイント低く評価する傾向があった。
- 大規模なデータセットを用いた客観的な評価手法の重要性が示唆された。
- モデル評価におけるバイアスを排除するための新たな手法開発の必要性が浮き彫りになった。
なぜ重要か
大規模言語モデルの客観的な評価における系統バイアスの存在は、モデル性能の正確な比較を困難にし、信頼性の高いAI開発のためには、評価手法自体の改善や標準化が急務であることを示している。