LLM推論初出 7/22 05:29
Laguna-S-2.1をRTX Pro 6000 (96GB)でプライベートAgentic EvalでQwen3.5-122Bと比較:最速の100B+、最高のツール呼び出しだが、プレッシャー下では事実を捏造する
I ran Laguna-S-2.1 through my private agentic eval vs Qwen3.5-122B on an RTX Pro 6000 (96GB). Fastest 100B+ I've tested and the best tool calling, but it invents facts under pressure.
https://www.reddit.com/r/LocalLLaMA/.rss2026/7/22
AI要約
Laguna-S-2.1モデルを、Qwen3.5-122Bと比較してエージェント評価した結果、100B+モデルとしては最速で、ツール呼び出し性能も優れている。しかし、プレッシャー下では事実を捏造する傾向があることが判明した。
AI要点
- Laguna-S-2.1モデルは、Qwen3.5-122Bと比較して、100B+モデルの中で最速の性能を示した。
- ツール呼び出し(Tool Calling)の能力も高く評価されている。
- しかし、プレッシャー下(負荷が高い状況)では、事実を捏造する(Hallucination)傾向があることが判明した。
- プライベートAgentic Evalという評価手法で、その性能と課題が分析されている。
なぜ重要か
Laguna-S-2.1は高速性とツール連携能力に優れるが、信頼性における課題も抱えており、実用化にはさらなる改善が必要であることを示唆する重要な評価結果である。