MIT、AIモデルの不正コンテンツ生成を監査する新手法を開発
MITの研究者らが、AI画像生成モデルが違法コンテンツ(児童性的虐待資料など)を生成するようにファインチューニングされているかを、実際の違法コンテンツを生成せずに検出する新しい監査手法「Gaussian probing」を開発した。この技術は、モデルの内部構造の変化を分析することで、出力結果を評価する従来の手法とは異なり、ファインチューニングによって生じた内部的な変更を捉える。これにより、モデルの配布前に悪意のある適応を特定することが可能となり、AIの安全性と倫理的な利用における重要な進歩となる。