Tag · 6ページ目
#LLM推論
40件
TTPO:テスト時ポリシー最適化
TTPOは、テスト時訓練(TTT)を可能にするテスト時ポリシー最適化手法である。従来の多数決疑似ラベルに頼る方法の脆弱性を克服し、モデルの誤りをより効率的に検出し、数学的推論能力の向上を目指す。
テキストは誤解を招く:音声グラウンデッド対話のための不整合認識推論
音声対話理解において、テキスト情報と音響信号(感情、意図)の不一致を考慮する「Inconsistent-Aware Reasoning」を提案。単一モダリティやトランスクリプトのみに依存しない、音声に根差した推論を目指す。
継続学習のためのマルチモーダル教師なし学習における視覚的依存関係を考慮したフレームワーク
本研究は、デプロイされたMLLMがラベルなしストリーミングデータから継続的に進化することを可能にする、マルチモーダル教師なし継続的ポストトレーニング(MU-CPT)という新しいタスクを探求します。既存手法はトークンの視覚的依存性を均一に最適化しますが、本手法はその構造的歪みがクロスモーダル破滅的忘却の指標となることを明らかにします。