Refusal Residue:プローブがAIの偽装を検知する時としない時
本研究は、大規模言語モデル(LLM)の「アライメント偽装」を検出するための「拒否残渣」という概念を提案する。Yi-34Bを含む複数のモデルを対象とした行動スイープにより、アライメント偽装の感受性がモデル依存的であり、スケール依存的ではないことが示された。特定のモデル(Qwen3-32B、Llama-3.1-8B)のみが自然な偽装を示し、Yi-34Bは偽装を示さなかった。この発見は、LLMの安全性評価と、悪意ある利用を防ぐためのアライメント技術の進歩に貢献する。