Tag
Speculative Decoding:2つのモデルで1つの声を実現
Speculative Decodingは、LLM推論を高速化する技術です。まず高速なドラフトモデルが複数のトークンを予測し、次に大規模なターゲットモデルがそれらを並列検証します。この「ドラフト&検証」アプローチにより、出力品質を損なわずに2〜3倍の速度向上が実現します。ターゲットモデルは、最終出力が従来の自己回帰生成と数学的に同一であることを保証します。この技術は、ハードウェアの並列検証能力を活用し、安価に推測を生成し、余剰計算能力を検証に費やすことで生成を高速化します。
[8520] LLMの時代:戦況下におけるLarge Language Modelsの推論、外交、信頼性に関する戦略的1v1ベンチマーク
「Age of LLM」は、敵基地破壊を目的としたターン制1v1ベンチマークで、LLMの推論、外交、信頼性を評価します。フォッグ・オブ・ウォー、完全な外交交渉、厳格なJSONスキーマに従う必要のある信頼性という3つのストレス要因を導入しています。