LLM推論重要度 ★10
ClinHallu: 医療MLLM推論における段階的幻覚の診断ベンチマーク
ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
https://export.arxiv.org/api/query·2026/6/12
AI要約
医療分野におけるマルチモーダルLLM(MLLM)の信頼性向上を目指し、段階的な幻覚(ハルシネーション)を診断するためのベンチマーク「ClinHallu」を提案しています。幻覚の原因が視覚認識、医療知識の想起、推論統合のいずれにあるかを特定する手法を開発し、医療MLLMの安全性と信頼性の向上に貢献します。
AI要点
- 医療分野におけるマルチモーダル大規模言語モデル(MLLM)の信頼性向上のため、「ClinHallu」ベンチマークが提案された。
- ClinHalluは、推論プロセスにおける段階的な幻覚(ハルシネーション)の発生源を診断することに焦点を当てている。
- 7,031件の検証済みインスタンスを含み、視覚認識、知識想起、推論統合の3段階に分解されている。
- 段階ごとの修正介入により、最終的な回答への影響を測定し、幻覚の根本原因特定を可能にする。
- 段階別ファインチューニングにより、段階的な幻覚を低減できることが示されている。
なぜ重要か
ClinHalluは、医療MLLMにおける幻覚の発生メカニズムを詳細に分析・診断するための初のベンチマークであり、より安全で信頼性の高い臨床意思決定支援ツールの開発に不可欠であるため重要です。