arXiv (NLP)AI
DLLM-TTS:テキスト音声合成のためのブロック離散拡散言語モデル
DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
現在のテキスト音声合成(TTS)システムは、相反するトレードオフに直面しています。自己回帰型のコーデック言語モデルは高い音声の明瞭性を実現する一方で、大規模なモデルと学習データを必要とし、トークンを逐次的にデコードしなければなりません。一方、非自己回帰的なアプローチは処理速度を向上させるものの、言語的な正確性が低下するという課題があります。
このような背景の中、研究者らはDLLM-TTSという新しいフレームワークを提案しました。このアプローチはTTSをX-Codec2ニューラルオーディオコーデックトークンに対する条件付きのブロック離散拡散として定式化しています。モデルは序列をブロックに分解し、各ブロック内でマスク拡散を適用しつつ、ブロックを逐次的に処理することで、ローカルな音響コヒーレンスとグローバルなテキスト音声間のアライメント両者を学習します。
推論時には、ブロック内での並列トークン予測が効率的な生成を可能にし、リアルタイムファクター(RTF)は0.15を達成しています。わずか6億パラメータのモデルであっても、2万時間のデータで学習することで、SeedTTS-evalベンチマークにおいて競争力のある性能を実現しています。このブロック離散拡散言語モデルのアプローチが、実用的かつデータ効率的な音声合成を可能にし、並列生成による高速化と言語的精度のバランスを実現することを実証しています。