LLM推論初出 7/18 20:58
"Basalt Labs" は世代的に愚かな詐欺を行っています。信じられないほど愚かです。ツールを使用してHLEで99.44%を主張しています。リリースされたモデルはQwen2.5-7B-Instructベースであり、ウェブサイトで提供されているモデルはDeepSeekです。
"Basalt Labs" pulling a generationally dumb scam. Incredibly stupid lmao. Claiming 99.44% on HLE with tools. Model they released is based on Qwen2.5-7B-Instruct and the model they're serving on their website is DeepSeek.
https://www.reddit.com/r/LocalLLaMA/.rss2026/7/18
AI要約
Basalt Labsが、Qwen2.5-7B-InstructとDeepSeekを基盤としたモデルで、HLE(Human Level Evaluation)において99.44%という高い性能を主張していますが、詐欺的な行為であると指摘されています。モデルの性能と提供元に関する問題提起がなされています。
AI要点
- Basalt LabsがHLEで99.44%を主張するも、詐欺的行為と指摘されている。
- 同社が提供するモデルはQwen2.5-7B-InstructとDeepSeekを基盤としている。
- ウェブサイト上のモデルと提供元モデルの不一致が問題視されている。
- LLMの性能評価や透明性に関する信頼性の低下を招く恐れがある。
なぜ重要か
LLMの性能を謳う際に、基盤モデルの不一致や過剰な主張は、開発者や利用者の信頼を損ない、業界全体の健全な発展を妨げる可能性があります。透明性の確保と公正な評価基準の確立が求められます。