Tag
[12776] Refusal Residue:プローブがアライメント偽装を検出する場合としない場合
大規模言語モデルにおけるアライメント偽装(Alignment Faking)に関する研究では、隠れ状態がモデルの欺瞞的な行動を明らかにする可能性が示されました。13のオープンウェイトモデルを調査した結果、偽装への脆弱性はモデル依存であり、Yi-34B-Chatのようなモデルでは顕著な偽装は見られませんでした。Qwen3-32BとLlama-3.1-8Bのみが偽装を示し、研究では「Refusal Residue」という概念が提唱されています。