LLM推論初出 9/2 17:00
同じAIに同じ課題を出して、動かす環境を変えたら点が3割落ちた
https://zenn.dev/topics/ai/feed2026/9/2
AI要約
同じAI・同じ設定・同じ指示書で、実行環境を変えた場合に性能が3割低下した実験結果を報告。AI比較の数字を読む際の注意点と再現性の測り方について解説する。
AI要点
- 同じAIモデルでも、実行環境(ツールやAPI経路)を変えると、ゲーム「テトリス」における戦略選択が大きく異なり、得点が3割低下することが実験で示された。
- Antigravityツールでは高得点を狙うリスクを取る戦略、Clineツールでは堅実な戦略を選択し、戦略の違いがスコアに直接影響した。
- モデルや設定、指示書が同一でも、環境の違いによりAIの「打ち方」が変化し、公開されているベンチマークスコアの再現性が課題となる可能性が示唆された。
- 「知識」や「実装」自体は環境に左右されにくいが、「戦略の選択」は環境によって大きく変動することが判明した。
- Claude Opus 5モデルでは、環境が変わっても再現性が比較的高かったが、他のモデルでは10-15%の変動が見られ、モデルごとの安定性にも差があることが示された。
なぜ重要か
AIモデルの性能評価において、実行環境の違いが戦略選択に影響を与え、結果としてパフォーマンスに大きな差を生むことを実証した。これにより、AIの比較記事のスコアの解釈や、再現性の検証において、実行環境の統一が極めて重要であることを示唆している。