LLM推論初出 8/11 02:59
自然さのその先へ:言語学的に根拠のある次元で自動音声合成評価器を調査する
Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
https://export.arxiv.org/api/query2026/8/11
AI要約
自動音声評価手法が人間の知覚をどの程度捉えているか不明瞭である。本研究では、音声を10の知覚次元に分解し、TTSのメタ評価ベンチマークを構築する。
AI要点
- 自動音声合成(TTS)評価器が人間の知覚をどの程度捉えているかを言語学的に検証した。
- 「自然さ」を10の知覚次元に分解し、メタ評価ベンチマークを構築した。
- MOS予測器は音響信号品質に偏り、Audio-LLM評価器は限定的で汎用性に欠けることが判明した。
- TTS評価の精度と解釈可能性を高めるためのデータセットと評価コードを公開した。
なぜ重要か
自動TTS評価器の限界を言語学的な観点から明らかにし、より精緻で信頼性の高い評価手法の開発を促進することで、高品質な音声合成技術の発展に寄与する。