研究/論文初出 8/12 02:55
特徴のバッグを超えて:スパースオートエンコーダーにおけるセットレベルの不安定性
Beyond a Bag of Features: Set-Level Instability in Sparse Autoencoders
https://export.arxiv.org/api/query2026/8/12
AI要約
スパースオートエンコーダにおけるセットレベルの不安定性を分析。従来の密な表現ではなく、SAEの潜在セットにおけるオーバーラップをより解釈性の高い類似度指標として用いる。SAEの潜在セットが、制御されたトイモデルにおいて結合的な構造を回復できることを検証する。
AI要点
- スパースオートエンコーダー(SAE)における、特徴量セットレベルでの不安定性(Set-Level Instability)を調査。
- SAEの活性化セットは、人間のカテゴリ境界や典型性をより忠実に反映するのではなく、モデル内部の類似性構造を追跡。
- SAEの特徴量が単純なBag-of-Featuresセマンティクスで構成されないことを、概念変化とSAEアクティブセット変化の不一致から示唆。
- 既存研究(Shani et al., 2026)とは異なり、SAEのセット類似度尺度は、人間の概念構造の復元よりもモデル内部構造との関連が強い。
- SAEの潜在セットは、理想化された設定以外では、人間の判断との乖離が見られ、単純な特徴量の寄せ集め以上の複雑な構造を持つ可能性。
なぜ重要か
SAEのような解釈可能なモデルアーキテクチャにおいても、その内部表現が人間の認知構造と必ずしも一致しないことを示す本研究は、モデルの解釈可能性を追求する上で、単純な類似性尺度だけでなく、より深い構造的理解が必要であることを示唆するため重要です。