LLM推論初出 9/3 01:51
同じ依頼文でClaudeとChatGPTの設計が割れた ― AIクロスレビューでも収束しなかった
https://zenn.dev/topics/ai/feed2026/9/3
AI要約
ClaudeとChatGPTで同じ依頼文に対する設計が異なり、AIクロスレビューでも収束しなかった。コーディングにおいては、ClaudeとChatGPT、GeminiなどのAIを比較検討することが重要である。
AI要点
- 同じ依頼文でも、ClaudeとChatGPTでHTMLファイルからデータを抽出する設計が異なり、AIによって設計判断が収束しなかった。
- GeminiはWebUIでのHTMLファイル読み込み上限により、途中までのデータしか解析できず、検証から脱落した。
- AIによるクロスレビューでは、正解が一意な問題は収束したが、設計判断の領域では「自分の立場の再表明」に留まった。
- AIは、URLの天気コード検出など、追加質問により不足情報を補完できたが、モデル間の差が見られた。
なぜ重要か
AIモデル間で設計判断が収束しないことは、プロンプトエンジニアリングの難しさを示している。特に、設計判断を伴うタスクでは、AIレビューは参考にはなるものの、最終的な判断は人間が行う必要があることを示唆している。