LLM推論初出 6/23 02:56
LLMは敵対的なプリフィルの自己申告を信頼して行えるか、そしてどのように?
Can LLMs Reliably Self-Report Adversarial Prefills, and How?
https://export.arxiv.org/api/query2026/6/23
AI要約
LLMが敵対的なプリフィルの影響を受けた自身の応答を、どの程度信頼性をもって自己報告できるかを調査。多様なモデルで実験した結果、信頼性の低い自己報告能力が示された。
AI要点
- LLMが敵対的なプリフィルによる影響を自己申告する能力を調査した。
- 実験の結果、LLMは自身の応答が敵対的プリフィルに影響されたかを正確に判断できないことが判明した。
- モデルごとに自己報告の信頼性にばらつきが見られた。
- LLMの自己認識能力の限界を示す結果となった。
なぜ重要か
LLMの応答の信頼性を評価する上で、敵対的攻撃に対する脆弱性と自己認識能力の限界を理解することは、安全で実用的なAIシステムの開発に不可欠である。