研究/論文重要度 ★9
損失は基盤を見ないが、Adamは見ている
The Loss Does Not See the Basis, but Adam Does
https://export.arxiv.org/api/query·2026/8/5
AI要約
勾配降下法とAdamの挙動の違いを解析し、Adamが低ランク解に暗黙的にバイアスされない理由を明らかにします。ゲージ対称性が鍵となります。
AI要点
- 行列分解モデルにおいて、損失関数は低ランク解を暗黙的にバイアスするが、Adamオプティマイザはそうではないことを示した。
- この違いは、損失関数のゲージ対称性と、それを満たすオプティマイザ(Gradient descent, AdamWなど)のゲージ等変性にあると分析した。
- Adamなどの座標ごとの更新ルールを持つオプティマイザはゲージ等変性を満たさず、低ランク解へのバイアスが失われる。
- Adamは、トランスフォーマーモデルにおいて、ゲージ等価な初期化を学習の初期段階で分離し、結果として異なる表現を獲得する。
なぜ重要か
オプティマイザの選択が、モデルの学習挙動と最終的な表現に大きな影響を与えることを明らかにした。特に、Adamのようなオプティマイザが低ランク解へのバイアスを持たないことは、モデルの表現能力や汎化性能に影響を与える可能性がある。