LLM推論重要度 ★9
SAEVerbalizer:表現言語化によるスパースオートエンコーダー特徴量の説明生成
SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
https://export.arxiv.org/api/query·2026/8/13
AI要約
SAEVerbalizerは、スパースオートエンコーダー(SAE)の特徴を説明するためのフレームワークである。SAEのデコーダー方向をLLMの表現に注入し、LLMのダウンストリームタスクのパフォーマンスを向上させるための説明を生成する。
AI要点
- スパースオートエンコーダー(SAE)の特徴量説明生成には、依然として外部観測への依存と計算効率の課題がある。
- 本研究では、SAEのデコーダー方向をLLMの表現に注入し、自然言語での説明生成を目指すフレームワーク「SAEVerbalizer」を提案する。
- SAEVerbalizerは、学習済みの言語モデルを通じて、デコーダー方向から直接SAE特徴量の説明を生成できる。
- 学習した説明能力は、未知の特徴量や異なるLLMのSAE特徴量にも汎化し、介入実験により特徴量の意味結合やシフトも確認された。
- これにより、SAE特徴量の解釈性が向上し、LLMの内部動作理解への貢献が期待される。
なぜ重要か
SAEVerbalizerは、SAE特徴量の解釈性を大幅に向上させ、LLMの内部表現の理解を深めるための新たな手法を提供する。これにより、AIモデルのデバッグや性能改善、さらには説明責任の向上に寄与する。