LLM推論初出 8/18 16:08
[モデル公開] tencent/AuK
https://huggingface.co/api/models2026/8/18
AI要約
tencent/AuKは、Tencentが開発したテキスト読み上げ(Text-to-Speech)モデルです。1,202DL、163いいねを獲得しています。自然で高品質な音声合成を実現することを目指したモデルと考えられます。音声技術の向上は、アクセシビリティやエンターテイメント分野での応用拡大に貢献します。
AI要点
- AuKは、音声生成と編集のための15億パラメータを持つオープンソースの基盤モデルである。
- 数百万時間分の多様な音声データで訓練され、ゼロショットTTS、指示ベースTTS、内容・音響編集、音声強調などを単一の自然言語インターフェースでサポートする。
- 高品質生成用の「AuK Base」と、高速4ステップ推論用の「AuK-Flash」の2つのバリアントがある。
- ピッチ、速度、音量、感情、声質、アクセント、非音声要素(息継ぎなど)の編集が可能。
- Hugging FaceおよびModelScopeでコードとモデルウェイトが公開されている。
なぜ重要か
自然言語による高度な音声編集を統一インターフェースで実現するAuKは、音声コンテンツ制作のワークフローを大幅に簡略化し、クリエイターの創造性を拡張する可能性を秘めている。