LLM推論2本の記事が同じ件を報じた初出 9/7 10:23
Artificial Analysisがベンチマークテスト更新 非公開データ拡充で「ゲーム化を防ぐ」
https://rss.itmedia.co.jp/rss/2.0/topstory.xml2026/9/7
AI要約
Artificial Analysisが知能指標「Intelligence Index」をv4.2に更新。実務に近い評価と非公開データの比重を倍増し、「ゲーム化を防ぐ」としている。首位はClaude Fable 5.1。
AI要点
- Artificial AnalysisがAIモデルのベンチマーク「Intelligence Index」をv4.2に更新した。
- 新評価項目として「AA-Briefcase」と「GDP.pdf」が追加され、非公開テストデータの比重が40%に増加した。
- この更新は、AI開発企業によるベンチマークテストの「ゲーム化」を防ぐことを目的としている。
- 更新後の首位はAnthropicのClaude Fable 5.1、次いでOpenAIのGPT-6 Astraとなった。
なぜ重要か
ベンチマークテストにおける「ゲーム化」防止策と非公開データの拡充により、AIモデルの真の性能評価がより正確になり、開発競争の健全化とユーザーの的確なモデル選択に貢献します。