LLM推論初出 6/3 10:52
なぜ我々はperlexityとproseでquantsをベンチマークするのに、tool call validityではしないのか?
Why do we benchmark quants on perplexity and prose but never on tool call validity?
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/3
AI要約
LLMのクオンタイゼーションモデルの評価基準として、パープレキシティや文章生成能力だけでなく、ツール呼び出しの妥当性も考慮すべきではないかという問題提起。構造化された出力(JSON形式など)の生成能力が、従来の評価指標では測りにくい側面があることを指摘している。