LLM推論重要度 ★9
分子のデジャヴュ:最先端LLMにおける桁レベルの公開値検索
Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
https://export.arxiv.org/api/query·2026/9/4
AI要約
最先端の言語モデルにおける分子値の正確な取得能力を評価する。22のモデルと12のベンチマークで verbatim retrieval(逐語的な数値取得)を監査し、多くのモデルが特定のベンチマークで過去の値を記憶していることを発見したが、その傾向はベンチマークに依存する。
AI要点
- 最先端LLMが分子物性ベンチマークで桁レベルの公開値検索を行う現象を調査した。
- 22の frontier model と12の regression benchmark を用いて verbatim retrieval を評価した。
- over 50% のLLMが verbatim retrieval を示す dataset が存在し、benchmark 依存性が示唆された。
- higher reasoning level で実験を行うと、retrieval の発生率が 89% 増加することが判明した。
- Retrieval を抑制すると、モデル間の prediction error の相対的な差が縮まることが示された。
なぜ重要か
LLMの評価において、予測能力と値の記憶・検索能力を区別する必要があることを示唆する。これは、LLMの真の汎化性能を理解する上で重要な指摘である。