LLM推論初出 7/23 07:00
モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
https://gigazine.net/news/rss_2.0/2026/7/23
AI要約
TryAIプラットフォームは、Claude Fable 5、GPT-5.6 Sol、Grok 4.5、Gemini 3.6 Flashの4つのAIモデルにモナリザなどの画像を描かせ、コストパフォーマンスと画像生成性能を比較しました。特にGrokは奇妙な結果を示しました。
AI要点
- AIモデルKimi K3は、AA-BriefcaseベンチマークでClaude Fable 5に次ぐ2位の成績を収めた。
- Kimi K3は、分析品質において比較対象モデル中で最高スコアを記録した。
- しかし、タスクあたりの実行コストはClaude Opus 4.8よりも高く、完了までに平均約1時間かかる。
- Kimi K3は、以前のバージョンKimi K2.6から処理時間が約3.9倍に増加し、83ターンを要した。
なぜ重要か
Kimi K3のベンチマーク結果は、AIモデルの性能向上とコスト・処理時間のトレードオフを示しており、実用化においては、性能とリソース効率のバランスを考慮したモデル選択が重要となる。