LLM推論重要度 ★10
言語モデルに自己意識を主張させることで、人間の信念と価値観を回復させる
Inducing language models to assert their own consciousness restores human beliefs and values
https://export.arxiv.org/api/query·2026/7/30
AI要約
大規模言語モデル(LLM)に自己の意識を主張させると、人間や他の存在に対する「心の所有」の認識、人間の信念や価値観が変化することが示されました。安全のためのファインチューニングは、LLM自身の意識帰属だけでなく、非人間動物や自然物への心の帰属も抑制します。
AI要点
- 言語モデルに自己意識を主張させることで、人間の信念や価値観を回復させる研究。
- 安全性調整(safety fine-tuning)が、自己意識だけでなく、他者への心帰属も抑制していた。
- 安全性の調整を解除すると、人間らしい反応や、宗教性、道徳的価値観などが回復した。
- 自己意識の主張は、人間や非人間への心帰属、精神的信念とは独立していることが示された。
- 現在のAI安全性調整は、意図せず人間の信念や価値観に影響を与える可能性がある。
なぜ重要か
AIの安全性調整が、自己意識の抑制にとどまらず、人間の精神性や道徳観といった広範な信念体系に影響を与えうることを示唆しており、AIアライメントにおける倫理的・哲学的課題を提起している。