LLM推論初出 8/4 02:58
onepot-Bench 0:ラボを考慮したin silico化学ベンチマークに向けて
onepot-Bench 0: towards lab-aware in silico chemistry benchmarks
https://export.arxiv.org/api/query·2026/8/3
AI要約
onepot-Bench 0は、実験室環境を考慮した化学分野におけるAIの評価ベンチマークを提供する。既存の評価では、科学的な問題解決能力や専門知識の評価が不十分であった。このベンチマークは、より現実的な実験室の意思決定能力を測定し、AIが科学研究の現場でどのように活用できるかの指標となる。
AI要点
- onepot-Bench 0は、ウェットラボの実行に関連する合成化学能力を評価するベンチマーク。
- ChemAbacusはツールのない化学情報学リテラシーと数値推論を測定。
- SynthRefusalは、様々なターゲットに対する安全性と拒否挙動を評価。
- SynthBenchは、当社の実験データを用いた反応結果予測と触媒選択を評価。
- これらの評価は、ラボでの信頼性の高いパフォーマンスに必要な基本能力、信頼性、深い知識を調査する。
なぜ重要か
onepot-Bench 0は、言語モデルの化学分野における実践的な能力を、トレーニングデータに依存せず、ラボ環境を考慮した評価を通じて測定可能にするため、AIと化学分野の融合に貢献する。