エージェント初出 8/5 02:59
SocietyBench: 社会・世界進化の反実仮想予測
SocietyBench: Forecasting Counterfactual Social-World Evolution
https://export.arxiv.org/api/query2026/8/5
AI要約
SocietyBenchは、LLMエージェントの社会的洞察力と将来予測能力を評価する新しいベンチマークである。既存のタスク完了能力の評価に加え、社会的な出来事がどのように展開するかを理解し予測する能力を測ることに焦点を当てている。WebニュースやSNS投稿を収集・分析し、イベントトピックの発展を追跡する。
AI要点
- 社会・世界の出来事の反事実的進化を予測するLLMの能力を評価するベンチマーク「SocietyBench」を提案する。
- SocietyBenchは、イベントトピックから時系列データを抽出し、固有名詞と日付を改変した反事実的シナリオで予測問題を生成する。
- 6つの最先端LLMを評価した結果、最強のモデルでも100点満点中75.0点にとどまり、予測精度とキャリブレーションの精度は両立しなかった。
- 3つのエージェントフレームワークはベースモデルの性能を向上させず、2つのヒューリスティック手法は全LLMを下回った。
- イベントごとに予測精度の差が大きいため、単一イベントではなく複数のイベントで評価することが重要であると指摘している。
なぜ重要か
LLMが単なる事実の記憶ではなく、複雑な社会事象の因果関係を理解し、変化する状況下で反事実的な未来を予測する能力を定量的に評価する手法を提供することで、より高度な社会理解能力を持つAIの開発を促進する。