LLM推論初出 9/11 09:00
DiscoSign:談話認識型テキストから手話グロスへの翻訳
DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation
https://machinelearning.apple.com/rss.xml2026/9/11
AI要約
DiscoSignは、談話レベルでの sign language gloss 翻訳を可能にするLLMベースのフレームワークです。従来の文単位の処理では見落とされがちな、空間的共参照といった談話現象を考慮し、より自然で理解しやすい手話翻訳を目指します。これにより、手話の複雑な表現をより忠実に再現することが期待されます。
AI要点
- 従来の音声認識から手話への翻訳システムは、文脈を考慮しないため、手話の理解において重要な課題があった。
- 本研究では、談話レベル(文脈)を考慮したテキストから手話グロスへの翻訳システム「DiscoSign」を提案する。
- DiscoSignは、空間的共参照、質問応答節(QAC)、概念とグロスの整合性といった談話現象をモジュール化されたLLMベースのフレームワークで処理する。
- 新たな評価指標を導入し、DiscoSignが文脈を考慮することで、空間的整合性とエンティティ追跡が大幅に向上することを示した。
- 本研究は、談話レベルでのテキストから手話グロスへの翻訳のための体系的なフレームワークと評価手法を初めて確立した。
なぜ重要か
手話の言語的特性である談話構造を考慮した翻訳システムを開発することで、手話の理解度と精度が向上し、聴覚障がい者と健聴者のコミュニケーションにおける障壁を低減し、アクセシビリティ向上に寄与する。