Tag
[5533] 不確かな判断から調整されたランキングへ:LLM評価のためのConformal Elo推定
本論文では、LLM評価におけるEloレーティングの精度向上に焦点を当て、LLM-as-a-judgeによる評価の不確実性とバイアスに対処する手法を提案している。ローカルレベルでは、勝率を直接Elo推定に組み込むことで、評価ごとの不確実性を考慮し、人間による評価との誤差を17.9 Elo MAEまで低減させた。
大規模言語モデルによるスケーラブルで信頼性の高い自動評価に向けて
本研究は、大規模言語モデル(LLM)の生成するテキストの品質と関連性を評価するための、専門家レベルの評価を近似する新しいフレームワークを提案する。複数のLLMによる出力のペアワイズ比較と、安定した解釈可能なランキングを生成するためのEloレーティングシステムを導入することで、既存の自動評価指標の限界を克服し、リソース集約的な人間の評価の必要性を大幅に削減することを目指す。この手法は、科学論文の要約から抽出された能力プロファイルを評価する際に、専門家の判断と相関の高いランキングを生成することを示唆している。
[8301] LLM Benchmarks 2026: ジョブごとの最適なモデル
2026年のLLMベンチマークは、MMLUのような飽和した評価指標から、HumanEvalの汚染問題、SWE-Benchの依存性、そしてChatbot Arena Eloのような人間による好感度を反映する指標へと進化しています。
TextClass Benchmark:社会科学におけるLLMの継続的なEloレーティング
TextClass Benchmarkは、社会科学分野におけるテキスト分類タスクを対象としたLLMおよびTransformerの継続的かつ動的な評価を提供します。Eloレーティングシステムをカスタマイズして採用し、パフォーマンス指標と相対ランキングを提示します。
[6077] 不確かな評価から校正されたランキングへ: LLM評価のためのConformal Elo推定
本研究は、LLMの評価における不確実な判断を、より校正されたランキングへと導くためのConformal Elo Estimation手法を提案する。LLM-as-a-judgeの評価における系統的誤差(位置バイアス、自己選好など)を、局所的(判断ごと)および大域的(モデルごと)なレベルで定量化する。
[5870] 大規模言語モデルのオープンエンド評価の再評価
本研究では、LLMの評価におけるEloレーティングシステムの限界と、データ内のバイアスを増幅する可能性を指摘しています。特に、オープンエンドな評価システムにおいて、冗長性への感度が高いEloシステムは、意図的または偶発的なバイアスを強化する可能性があります。
[5682] 不確かな判断から調整済みランキングへ:LLM評価のためのConformal Elo Estimation
本論文では、LLM-as-a-judgeによる評価における不確実性とバイアスを軽減するためのConformal Elo Estimation手法を提案する。ローカルレベルでは、判断の勝率を確率的に扱い、Elo推定の精度を大幅に向上させる。
[5360] 不確かな判断から校正されたランキングへ:LLM評価のためのConformal Elo Estimation
本研究は、LLMによる評価におけるEloレーティングの不確実性を定量化し、キャリブレーションされたランキングを提供するための「Soft-Elo」手法を提案する。LLMによるジャッジングのバイアスを軽減するために、個々のバトル結果の不確実性をローカルレベルで推定し、さらにモデル全体のEloレーティングのグローバルレベルでの不確実性を共形予測を用いて提供する。