Tag
Arena Elo解説:LMArenaチャットボットランキングの仕組み
Chatbot Arena Eloは、ユーザーのブラインド投票に基づいてAIモデルのランキングシステムです。ユーザーがプロンプトを送信し、2つの匿名モデルが応答し、ユーザーがより良い応答を選択します。結果は、チェスで使用されるEloレーティングシステムにフィードされ、より強力な対戦相手に勝つことでレーティングがより多く上昇します。レーティングは約1200(旧モデル)から約1440(最先端モデル)の範囲です。Eloレーティングは、ベンチマークスコア(MMLU、GPQA、SWE-bench)が標準化されたタスクの正しさを測定するのに対し、モデルの使い心地を捉えるため、影響力のある評価方法となっています。
Arena Eloの解説:LMArena Chatbotランキングの仕組み
Chatbot Arena Eloは、人間の好意によるブラインドな対戦投票に基づいたAIモデルのランキングシステムです。ユーザーがプロンプトを入力し、2つの匿名モデルが応答し、ユーザーがより優れた応答を選択します。結果はチェスプレイヤーのランキングに使用されるEloレーティングシステムにフィードされます。このシステムは、ベンチマークでは捉えられない、モデルの使用感を捉えるため、最も影響力のあるAI評価方法の1つとなっています。現在のトップモデルは1400〜1440の範囲にあり、1350以上のスコアは一般的なチャットで競争力があると見なされます。Eloレーティングは進化しており、新しいモデルの登場やユーザー層の変化によって変動します。
[8301] LLM Benchmarks 2026: ジョブごとの最適なモデル
2026年のLLMベンチマークは、MMLUのような飽和した評価指標から、HumanEvalの汚染問題、SWE-Benchの依存性、そしてChatbot Arena Eloのような人間による好感度を反映する指標へと進化しています。
[5872] Chatbot Arenaおよびその他のベンチマークにおけるYi-34B-Chatのランキング
Yi-34B-Chatは、2026年6月13日時点のChatbot Arenaリーダーボードにおいて、Claude-1やQwen1.5-72B-Chatなどのモデルと比較して高い評価を得ています。
[5356] Chatbot Arena + - OpenLM.ai
Chatbot Arena+は、AIモデルのパフォーマンスを比較するためのリーダーボードを提供しています。Yi-34B-Chatは1134のスコア(2026年6月9日時点)で、Apache-2.0ライセンスを持つ01 AIによって開発されたモデルです。
Chatbot Arena リーダーボード
Chatbot Arenaは、LMSYS/UC Berkeleyが運営する、LLMの応答をペアで比較する人間による評価に基づいたリーダーボードです。Elo Ratingを指標とし、様々なタスクにおけるモデルの相対的なパフォーマンスを人間による判断でランク付けします。2024年以降はlmarena.aiに移行し、定期的に更新されています。
[184] 01.AI Yi Model Lineage 2026:Yi-Coder、Yi-Lightning、Yi-Large
2026年5月15日付けのPresenc AIの記事によると、01.AIのYiモデルラインは2024年から2026年にかけて進化しており、Yi-34Bは2023年後半に登場した。Yi-Lightningは、Chatbot Arenaでトップ10入りし、OpenAIのモデルと比較して低コストで高い性能を示した。
[115] Chatbot Arena + - OpenLM.ai
Chatbot Arena +では、Yi-1.5-34B-Chatが1178のスコアで、Yi-34B-Chatは1134のスコアで、それぞれ上位にランクインしています。これは、OpenLM.aiが提供する評価プラットフォームにおける、大規模言語モデル(LLM)の性能比較に基づいています。