Tag
LLM Leaderboardの歴史:AIランキング2023→2026を追跡 | BenchLM.ai
2026年7月現在、ArenaリーダーボードはClaude Opus 4.6が1501 Eloでリードしており、2023年5月のVicuna-13B(1094 Elo)から407ポイント上昇しました。このEloレーティングは、チェスのランキングと同様に、人間による匿名でのモデル比較の勝率に基づいており、自動ベンチマークよりも実世界でのLLMの品質を信頼できる指標として広く認識されています。
[8156] LMArena Text Leaderboard - LLM Stats
LMArena Text Leaderboardは、実際の会話におけるユーザーの好みに基づいたペアワイズ比較でモデルをランク付けする、ブラインド人間評価ベンチマークです。Eloレーティングは、モデル間の直接対決でのユーザーの好意から計算され、モデルの全体的な能力とスタイルを包括的に測定します。
[7567] ベストオープンソースLLM(2026):ベンチマーク、サイズ、ユースケース別ランキング
GPT-OSS-120bは、Codeforcesで2622のEloレーティングを達成し、OpenAIのo4-miniに匹敵する性能を示した。
TextClass Benchmark: LLMの継続的なEloレーティングを社会科学で評価
TextClass Benchmarkプロジェクトは、社会科学分野のテキスト分類タスクにおけるLLMとTransformerの継続的かつ動的な評価システムを導入。カスタマイズされたEloレーティングシステムを採用し、新しいモデルやテストセットを定期的に取り込むことで、公平で最新のランキングを提供する。
Chatbot Arena リーダーボード
Chatbot Arenaは、LMSYS/UC Berkeleyが運営する、LLMの応答をペアで比較する人間による評価に基づいたリーダーボードです。Elo Ratingを指標とし、様々なタスクにおけるモデルの相対的なパフォーマンスを人間による判断でランク付けします。2024年以降はlmarena.aiに移行し、定期的に更新されています。