Tag
最高のオープンソースLLM:2026年7月リーダーボード(更新)
7月19日時点の最新情報によると、GLM-5.2がエージェントコーディングと推論においてオープンソースLLMリーダーボードのトップに躍り出た。Kimi K3は、7月27日にウェイトが公開される予定だが、生能力では僅差で2位につけている。DeepSeek V4とQwen3.6がフロンティア近辺のティアを形成している。GLM-5.2は、SWE-bench Proで62.1%、Terminal-Bench 2.1で81.0%のスコアを達成し、Claude Opus 4.8に迫る性能を示している。Kimi K3は、SWE Marathonでトップとなり、ArenaのFrontend CodeリーダーボードでもClaude Fable 5を上回った。しかし、ウェイト公開は7月27日まで待つ必要がある。
[2395] LLM Benchmark Leaderboard 2026: コーディング、数学、推論、エージェント | CodeSOTA
2026年のLLMベンチマークリーダーボードでは、MMLU、GPQA Diamond、AIME 2025、LiveCodeBench Proなどの評価項目で、Gemini 3.1 ProがLiveCodeBench Proで2887のEloを記録。透明性を重視しつつ、ベンチマークの不正利用や汚染に注意を促しています。
[1410] LLM Benchmark Leaderboard 2026: コーディング、数学、推論、エージェント
2026年のLLMベンチマークリーダーボードは、知識、推論、数学、コーディング、エージェントタスクを評価。Gemini 3 Pro、DeepSeek-V4-Pro Max、Kimi K2.6などの最新モデルをリストアップ。ベンチマークスコアへの過信は禁物であり、エージェントベンチマークの不正利用の可能性も指摘されています。
LLM Benchmark Leaderboard 2026: コーディング、数学、推論、エージェント
2026年5月20日発表のLLMベンチマークリーダーボードでは、Gemini 3 ProがLiveCodeBench Proで2439Eloを記録し、コーディング能力でトップとなりました。このリーダーボードは、知識、推論、数学、コード、および持続的なツール使用における最先端モデルのパフォーマンスを、ベンダーの宣伝を排除し、正確な日付とソースリンク付きで、独立かつ正直に測定することを目指しています。