研究/論文重要度 ★9
計算プロパガンダによる事前学習データの汚染
Pretraining Data Can Be Poisoned through Computational Propaganda
https://export.arxiv.org/api/query·2026/7/16
AI要約
学習データへの計算プロパガンダによる「汚染」の可能性を指摘。大規模かつ多様な事前学習コーパスを対象に、データキュレーションパイプラインとの相互作用も考慮した、検出・緩和が困難な有害行動の導入を実証。
AI要点
- 計算プロパガンダを用いて、大規模言語モデル(LLM)の事前学習データを汚染する攻撃手法が示されました。
- 従来のWikipediaのような限定的なデータソースではなく、一般公開された議論インターフェースを悪用する可能性を指摘しています。
- Webクロールとデータキュレーションのプロセスを経て、悪意のあるコンテンツがLLMの学習データに含まれるかを推定する「HalfLife」という分析手法を提案しています。
- 第三者のWebページコンテンツが、LLMの事前学習データに対する攻撃ベクトルとなる可能性が示唆されています。
- 事前学習データの汚染は、検出・緩和が困難な有害な振る舞いをLLMに導入する可能性があると警鐘を鳴らしています。
なぜ重要か
計算プロパガンダによる事前学習データの汚染は、LLMの信頼性と安全性を根本から脅かす可能性があり、データ収集・キュレーションプロセスにおけるセキュリティ対策の必要性を浮き彫りにします。