Tag
Speculative decodingがLLM推論を50%以上高速化
DeepSeekが開発したDSparkは、小規模なドラフトモデルが生成したトークンを大規模言語モデルが検証する投機的デコーディング手法です。これにより、テキスト生成速度を50%以上向上させつつ、精度を維持することに成功しました。DSparkは、ドラフトモジュールの追加により既存のDeepSeekモデルの性能を強化し、MITライセンスで公開されています。