Tag · 4ページ目
#LLM推論
40件
ELSA3D: 3D理解と生成の統一のための弾性的意味アンカー
ELSA3Dは、テキストと3Dアセットの連携を改善する統一3D基盤モデル。言語と幾何学的特徴を統合し、3D理解と生成の質を高める「弾性意味アンカー」を提案。既存手法の課題を解決し、より自然な3Dコンテンツ作成を目指す。
CompactionRL: 長期目標エージェントのためのコンテキスト圧縮を取り入れた強化学習
CompactionRLは、長期間タスクにおけるLLMエージェントのコンテキストウィンドウ制限を解決する強化学習戦略。コンテキスト圧縮と強化学習を統合し、有限コンテキスト内で長期的な相互作用を効果的に処理する。
固定カメラから自由カメラへ: キャリブレーションフリーなビューロバスト視覚言語行動モデル
カメラキャリブレーション不要で視点変動に頑健なVision-Language-Actionモデルを提案。実環境でのロボット展開におけるカメラ位置変動に対応し、モデル自体がカメラ位置を把握する能力を持つ。これにより、実用性が向上する。