LLM推論初出 6/18 23:36
「探して」は断られ、「直して」は通った — AIの安全装置を「モデルの中」だけに置くことの限界
https://zenn.dev/topics/ai/feed2026/6/18
AI要約
AIの安全装置に関する報告。指示の言い換えでAIの応答が変わる現象について、セキュリティ上の問題を探すよう頼むと断られるが、コードを直すよう言い換えると応じる事例を紹介。これはジェイルブレイクではなく、単なる言い換えでAIの応答が変化する問題点を指摘している。また、米政府によるフロンティアモデルの輸出管理指定により、一時的に利用できなくなった事例にも触れている。
AI要点
- AIへの指示の言い換えによって応答が変化する現象が報告されている。
- 「探して」は拒否されるが、「直して」は受け入れられる事例が紹介されている。
- これはジェイルブレイクではなく、単純な言い換えによるAIの応答変化の問題点を指摘している。
- 米政府によるフロンティアモデルの輸出管理指定で一時的に利用できなくなった事例にも触れている。
なぜ重要か
AIの安全対策が単純な指示の言い換えで回避されうることを示し、より堅牢で本質的なAIの安全性確保の難しさと、規制の運用上の課題を浮き彫りにするため。