Tag
Arena Elo解説:LMArenaチャットボットランキングの仕組み
Chatbot Arena Eloは、ユーザーのブラインド投票に基づいてAIモデルのランキングシステムです。ユーザーがプロンプトを送信し、2つの匿名モデルが応答し、ユーザーがより良い応答を選択します。結果は、チェスで使用されるEloレーティングシステムにフィードされ、より強力な対戦相手に勝つことでレーティングがより多く上昇します。レーティングは約1200(旧モデル)から約1440(最先端モデル)の範囲です。Eloレーティングは、ベンチマークスコア(MMLU、GPQA、SWE-bench)が標準化されたタスクの正しさを測定するのに対し、モデルの使い心地を捉えるため、影響力のある評価方法となっています。
Arena Eloの解説:LMArena Chatbotランキングの仕組み
Chatbot Arena Eloは、人間の好意によるブラインドな対戦投票に基づいたAIモデルのランキングシステムです。ユーザーがプロンプトを入力し、2つの匿名モデルが応答し、ユーザーがより優れた応答を選択します。結果はチェスプレイヤーのランキングに使用されるEloレーティングシステムにフィードされます。このシステムは、ベンチマークでは捉えられない、モデルの使用感を捉えるため、最も影響力のあるAI評価方法の1つとなっています。現在のトップモデルは1400〜1440の範囲にあり、1350以上のスコアは一般的なチャットで競争力があると見なされます。Eloレーティングは進化しており、新しいモデルの登場やユーザー層の変化によって変動します。
LLM Leaderboardの歴史:AIランキング2023→2026を追跡 | BenchLM.ai
2026年7月現在、ArenaリーダーボードはClaude Opus 4.6が1501 Eloでリードしており、2023年5月のVicuna-13B(1094 Elo)から407ポイント上昇しました。このEloレーティングは、チェスのランキングと同様に、人間による匿名でのモデル比較の勝率に基づいており、自動ベンチマークよりも実世界でのLLMの品質を信頼できる指標として広く認識されています。
LMArena Text Leaderboard - LLM統計
LMArena Text Leaderboardは、現実世界の対話における人間による好みを評価するベンチマークです。Eloレーティングシステムを採用し、モデル間の直接比較(ヘッドツーヘッドバトル)から得られたユーザーの好みに基づいてモデルをランク付けします。これにより、モデルの全体的な能力とスタイルが評価されます。