Tag
2026年ライティング向けLLM:クリエイティブ、コピーライティング、コンテンツ - EVY
2026年7月20日発表のEVYのレポートによると、LLMのライティング能力評価にはEQ-Bench Creative WritingやLMArena Textなどが用いられています。特にEQ-Bench Creative Writingでは、Kimi K3が1300〜2380のEloスケールで2377という高評価を得て、Claude Fable 5(2091)、Claude Opus 4.7(2047)を上回りました。これは、物語の質、感情的な深み、文体、キャラクターボイスなどを評価する専門的なベンチマークです。
Arena Elo解説:LMArenaチャットボットランキングの仕組み
Chatbot Arena Eloは、ユーザーのブラインド投票に基づいてAIモデルのランキングシステムです。ユーザーがプロンプトを送信し、2つの匿名モデルが応答し、ユーザーがより良い応答を選択します。結果は、チェスで使用されるEloレーティングシステムにフィードされ、より強力な対戦相手に勝つことでレーティングがより多く上昇します。レーティングは約1200(旧モデル)から約1440(最先端モデル)の範囲です。Eloレーティングは、ベンチマークスコア(MMLU、GPQA、SWE-bench)が標準化されたタスクの正しさを測定するのに対し、モデルの使い心地を捉えるため、影響力のある評価方法となっています。
Chatbot Arena Eloは、人間の好意によるブラインドな対戦投票に基づいたAIモデルのランキングシステムです。ユーザーがプロンプトを入力し、2つの匿名モデルが応答し、ユーザーがより優れた応答を選択します。結果はチェスプレイヤーのランキングに使用されるEloレーティングシステムにフィードされます。このシステムは、ベンチマークでは捉えられない、モデルの使用感を捉えるため、最も影響力のあるAI評価方法の1つとなっています。現在のトップモデルは1400〜1440の範囲にあり、1350以上のスコアは一般的なチャットで競争力があると見なされます。Eloレーティングは進化しており、新しいモデルの登場やユーザー層の変化によって変動します。