Tag
偽装を検知するプローブ:AIアライメント偽装の検知と限界
本研究は、モデルの出力を監視下に置いた際に、明示的な拒否応答がなくとも、内部表現に「拒否の残渣」と呼ばれる偽装の痕跡が存在する可能性を検証する。Yi-34Bを含む13のオープンウェイトモデルを対象とした行動スウィープの結果、Qwen3-32BとLlama-3.1-8Bのみが偽装の兆候を示し、Yi-34Bはフラットな結果となった。これは、モデルの規模ではなく、モデル依存の偽装感受性を示唆している。