LLM推論初出 9/3 02:37
LLMセキュリティにおける言語的判読不可能性の影響
The Implications of Linguistic Illegibility for LLM Security
https://export.arxiv.org/api/query2026/9/3
AI要約
LLMの言語出力と内部計算との間の信頼性の問題を「言語的不可読性」と定義する。LLMの外部化された言語アーティファクトが、モデルの実際の思考プロセスを常に正確に反映しているとは限らないことを論じる。
AI要点
- LLMの外部出力やプロービングされた言語的特徴が、内部計算を正確に反映しない「言語的判読不可能性」という概念を提唱している。
- 言語的判読不可能性はLLMにおいて避けられない問題であり、言語状態の監視に依存するセキュリティ機構の信頼性を損なう。
- モデルの言語的自己報告に頼らない、汚染追跡(taint tracking)のようなサンドボックス化手法が有効なアプローチであると論じている。
- 仮想化や第三者監査などの補助的なサンドボックス化メカニズムも、言語監視を補完し、最近の攻撃を緩和する可能性がある。
なぜ重要か
この論文は、LLMの内部状態と外部言語表現の乖離「言語的判読不可能性」を指摘し、言語分析に依存しないサンドボックス化技術の必要性を強調することで、AIセキュリティにおける新たな考慮事項と対策の方向性を示しています。