LLM推論初出 5/26 02:59
被写体駆動生成のためのマルチモーダル大規模言語モデルからの容量の絞り込み
Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
https://export.arxiv.org/api/query2026/5/26
AI要約
被写体指向の画像生成において、既存手法の課題であるクロスモーダル推論能力の限界とコピー&ペーストアーティファクトを改善。マルチモーダルモデルと拡散モデルを連携させ、同一性保持能力を向上させる手法を提案。