研究/論文初出 7/31 12:55
Peter Steinberger氏、Anthropicが投稿したARC-AGI-3の結果を批判、OpenAIがすぐに無意味にした
Peter Steinberger called out Anthropic for posting ARC-AGI-3 results that OpenAI quickly made look absurd
https://startupfortune.com/feed/2026/7/31
AI要約
Peter Steinbergerは、AnthropicがARC-AGI-3ベンチマークの結果を公開する前に確認したか疑問を呈した。OpenAIが、Anthropicのスコアを大幅に上回る結果をAPI設定の変更のみで達成したことを示したためである。
AI要点
- AnthropicのARC-AGI-3ベンチマーク結果発表に対し、Peter Steinberger氏が疑問を呈した。
- OpenAIは、API設定の変更のみでGPT-5.6 Solのスコアを大幅に向上させたと主張している。
- AnthropicのClaude Opus 5は30.2%を記録したが、OpenAIの主張が事実か検証が必要とされる。
- ベンチマークの信頼性確保のため、発表された数値や主張の根拠となる情報源の確認が重要であると指摘されている。
なぜ重要か
AIモデルの性能評価におけるベンチマークの信頼性とその解釈の重要性を示唆しており、競争環境下での結果発表における透明性と検証可能性の必要性を浮き彫りにしている。