Tag
#👍28
5件
HyQuant: LLM Attentionのためのハイブリッド精度量子化
LLMのトレーニングと推論において、量子化はコスト削減と効率向上のために広く採用されています。しかし、低ビット量子化は、特にアテンションモジュールにおいて大きな誤差を生じさせ、性能低下を引き起こす可能性があります。本研究では、精度と効率のバランスを改善するハイブリッド量子化設計「HyQuant」を提案します。
Negative Self-Distillation: 欠陥を回避して推論を学習する
オンポリシー自己蒸留(OPSD)は、LLMの自己改善に人気がありますが、複雑な推論タスクで性能を低下させる可能性があります。OPSDは、学生モデルに過度に自信のある推論を強制し、不確実性の表現や自己修正行動を抑制します。これを解決するため、本研究では「ネガティブ自己蒸留(NSD)」という新しいフレームワークを提案します。
TempCloze: 動画言語モデルは欠落した中間部分を特定できるか?
TempClozeは、Video-LLMの視覚的時系列推論を評価するためのビデオ穴埋めベンチマーク。動画の開始と終了クリップが与えられ、モデルは4つの候補から真の欠落中間部分を特定する必要がある。言語的ショートカットを減らすため、意味、タイミング、進行の3次元に沿った選択肢を構築する。
再帰的コードワールドモデル: 再帰的なシーンプログラムを通じて複雑な世界を構築する
Recursive Code World Models (RCWM)は、単一参照画像から複雑な3D世界をコードで再構築するフレームワーク。再帰的シーンプログラム(RSP)表現と、自身を再帰的に呼び出す構築ソルバーを組み合わせる。全体像の確立、未解決部分の再帰的再構築、全体の見直しによる合成の洗練といったプロセスを繰り返す。
World in World: World Modelsで世界を探求する
World in Worldは、自動回帰型ビデオワールドモデルにおける柔軟な制御を可能にする、トレーニング不要な推論時インターフェース。ソース動画を新しい視点から探索する際に、生成されるロールアウトが記録されたイベントと同期し、指定されたビューにコンテンツを配置し、新規領域を補完し、再訪時に以前生成された外観を回復する。