LLM推論重要度 ★9
Supabase、Claude Code、Codex、OpenCodeの評価用コードをオープンソース化
Supabase Open-Sources Evals to Grade Claude Code, Codex and OpenCode
https://startupfortune.com/feed/·2026/8/1
AI要約
Supabaseは、Claude Code、Codex、OpenCodeといったAIコーディングエージェントを、スキーマ構築やRLSポリシー修正などの実際のバックエンドタスクで評価するApache-2.0ライセンスのベンチマーク「Evals」をオープンソース化しました。
AI要点
- Supabaseが、AIコーディングエージェントを評価するベンチマーク「Evals」をオープンソース化しました。
- Evalsは、Claude Code, Codex, OpenCodeなどを実際のバックエンドタスクで評価します。
- 初期結果では、Opus 5やKimi K3は単独で100%の精度を達成しました。
- Sonnet 5は、コンテキスト情報(skills)を提供することで78%から100%に向上しました。
なぜ重要か
AIコーディングエージェントの性能を実用的なタスクで評価するベンチマークの公開は、各モデルの能力差や、コンテキスト情報の重要性を可視化し、開発者によるAIツールの選定・活用に貢献します。