Tag
#hn-score:171
3件
LLM推論初出 9/13 05:25
Real-SWE:プライベートな実世界のエンタープライズコードベースでのAIモデルのベンチマーク
Real-SWEは、最先端のAIモデルを、実際の企業のプライベートなコードベースで評価するためのベンチマークです。タスクは、実際の企業のプロダクションコードから抽出され、既存製品の複雑さや文脈を反映しています。企業固有のルールやコーディング規約を理解し、ビジネスに影響を与える変更(請求、税金計算、顧客移行など)を正確に行えるかが評価されます。
https://hacker-news.firebaseio.com/v0
LLM推論初出 8/23 01:58
Anthropic、Claude Codeで努力レベルをA/Bテストか
AnthropicがClaudeのコード生成における努力レベルをA/Bテストしている可能性について報告。モデルの応答品質と計算コストのバランスを最適化するための実験的なアプローチを探求している。
https://hacker-news.firebaseio.com/v0
ツール/フレームワーク初出 6/2 03:54
GitHubとソフトウェアに対する犯罪
GitHub CopilotなどのAIコーディング支援ツールの普及が、ソフトウェア開発のあり方や著作権、倫理的な問題について議論を巻き起こしています。開発者コミュニティ内での賛否両論が示されています。
https://hacker-news.firebaseio.com/v0