研究/論文初出 5/18 06:58
Constitutional AI: AIフィードバックからの無害性
Constitutional AI: Harmlessness from AI Feedback
Constitutional AI2026/5/18
AI要約
Constitutional AI (CAI)は、AIアライメントのための手法であり、AI自身が人間が定義した原則(「憲法」)に基づいて自己評価・自己修正を行うことで、有害な出力を抑制しつつ有用性を維持する。この手法は、人間のフィードバックへの依存を減らし、AIの意思決定をより透明にする。CAIは、教師あり学習とAIフィードバックからの強化学習(RLAIF)の2段階で訓練される。