LLM推論初出 8/11 02:47
LLMの頑健性診断ストレステスト:デコーディングレベルでのタブー
Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
https://export.arxiv.org/api/query2026/8/11
AI要約
LLMの評価は通常、最適化された状況下で行われる。本研究では、実運用で発生するLLMの挙動変化を捉えるための「Decoding-Level Taboo」を提案する。
AI要点
- 大規模言語モデル(LLM)の評価は通常、正常な条件下での性能に焦点を当てており、実環境での性能との乖離が生じている。
- 「Decoding-Level Taboo」は、LLMのロジット空間に直接介入し、モデルを通常の生成パスから強制的に逸脱させる診断用ストレステスト手法である。
- この手法は、単語境界で候補トークンを動的にマスキングすることで、モデルに迂回的な表現を強制させる。
- 実験の結果、オフパス(逸脱)時の頑健性は、パラメータ規模と指示チューニング(アライメント)に大きく影響され、モデルサイズが大きいほど、またアライメントが進んでいるほど改善する。
- Tabooは、多様な合成データセット生成、ランタイムの安全ガードレールのストレステスト、デプロイ前の信頼性監査に利用できる新しい手法である。
なぜ重要か
Decoding-Level Tabooは、LLMが想定外の状況下でどのように振る舞うかを評価する新たな手法であり、実環境でのAIの信頼性や安全性を高めるための重要な診断ツールとなり得る。