3.7 Flashからの改善: ソフトウェアエンジニアリング、エージェンティックタスク、専門分野における複雑で多段階の推論で大幅な改善
コスト: $0.75 per million input tokens and $3.75 per million output tokens
DeepSWE v1.1: ほとんどのより大きなフロンティアモデルをアウトパフォームし、複雑なエンジニアリング問題をエンドツーエンドで自律的に解決
DeepSWE v1.1における性能: ほとんどのより大規模なフロンティアモデルを自律的に上回る
HLE-Verifiedにおける性能: 54.9%