Tag
Multimodal ModelsのためのSpeculative Decoding:サーベイ
本サーベイは、Vision-Language、Vision-Language-Action、Video-Language、Speech、Text-to-Image、Diffusionモデルなど、様々なモダリティにおける多峰性生成モデルの推論を高速化するSpeculative Decoding (SD)手法を体系的にレビューする。
DSpark:半教師あり生成による信頼度スケジューリング型推論デコーディング
DSparkは、LLM推論を加速する投機的デコーディングフレームワークであり、高スループットの並列生成と適応的で負荷認識型の検証を統合します。半自己回帰アーキテクチャを採用し、並列バックボーンと軽量シーケンシャルモジュールを組み合わせることで、ブロック内の依存関係モデリングを導入し、サフィックスの減衰を軽減します。
Speculative Decoding AI研究
Speculative decodingは、大規模言語モデル(LLM)の推論速度を向上させるAI技術です。小型の「ドラフト」モデルでトークン列を予測し、大型の「検証」モデルでそれを確認することで計算オーバーヘッドを削減します。これによりLLMのテキスト生成速度が大幅に向上し、リアルタイムアプリケーションや大規模展開での効率を高めます。
Parallel-EAGLE (P-EAGLE) はドラフト生成を並列化することでSpeculative Decodingを加速する
AWSは、ドラフトトークン生成プロセスを並列化する革新的な手法「Parallel-EAGLE (P-EAGLE)」を導入した。これは、推測深度が増加するにつれて遅延が発生する従来のアウトリグレッシブアプローチとは異なり、P-EAGLEは単一のフォワードパスで全ての推測ドラフトトークンを同時に予測し、このボトルネックを解消する。
Parallel-EAGLE: Speculative Decodingを完全並列処理に変換
AWSが開発したParallel-EAGLE(P-EAGLE)は、従来の逐次的なドラフト生成プロセスを完全に並列化する画期的な手法であり、推論速度を向上させるSpeculative Decodingをさらに進化させた。