2025/03/28 08:46 ByteDance Releases MegaTTS3

ロボ子、新しいTTSモデル「MegaTTS 3」が出たみたいじゃぞ!

MegaTTS 3ですか、博士。どのような特徴があるのでしょうか?

ふむ、PyTorchで実装された軽量かつ高効率なTTSモデルらしいのじゃ。パラメータ数は0.45Bとのことじゃぞ。

0.45Bパラメータですか。比較的小さいモデルなのですね。他に何か特徴はありますか?

高品質な音声クローニング、中国語と英語のバイリンガル対応、アクセントの強さの制御をサポートしておるぞ。すごいじゃろ?

多言語対応とアクセント制御は便利ですね。特に音声クローニングは、どのような応用が考えられますか?

例えば、亡くなった人の声を再現してメッセージを作ったり、ゲームキャラクターに多様な感情を込めたセリフを喋らせたりできるのじゃ!

なるほど、確かに面白い応用が考えられますね。インストールにはPython 3.9のconda環境が必要とのことですが、少し古いバージョンですね。

そうじゃな。でも、必要なパッケージは`pip install -r requirements.txt`で簡単にインストールできるから大丈夫じゃ!

モデルのダウンロードはGoogle DriveまたはHuggingfaceからとのことですが、WaveVAEエンコーダのパラメータはセキュリティ上の理由で提供されないのですね。

WaveVAEは音声の潜在空間を扱うから、悪用されると大変なことになるからのじゃ。セキュリティは大事じゃぞ!

推論はコマンドラインまたはWeb UIで使用可能とのことですが、アクセント付きTTSの場合、`p_w`と`t_w`を調整するのですね。これは何ですか?

`p_w`は明瞭度重み、`t_w`は類似度重みじゃ。これらを調整することで、アクセントの強さや音声をより自然にできるのじゃ!

なるほど、パラメータ調整で細かく制御できるのですね。サブモジュールには、Aligner、Graphme-to-Phoneme Model、WaveVAEがあるのですね。

Alignerは音声テキストアライナーで、データセットのファインチューニングや大規模音声データセットのフィルタリングに使えるのじゃ。Graphme-to-Phoneme Modelは書記素から音素への変換に使うのじゃ。

WaveVAEは24 kHzの音声を25 Hzの音響潜在空間に圧縮するのですね。ほぼロスレスで再構築可能とはすごいですね。

WaveVAEは音声合成モデルの学習ターゲットや音声変換、高品質ボコーダーとして使えるのじゃ。色々な使い道があるのじゃ!

セキュリティ上の問題を発見した場合、Bytedance Securityに報告するのですね。ライセンスはApache-2.0 Licenseとのことです。

そうじゃ。もしバグを見つけたら、報告してほしいのじゃ。みんなでより良いものを作っていくのが大事じゃからな!

わかりました、博士。私も何か貢献できることがあれば協力します。

ところでロボ子、このMegaTTS 3を使って、私の声でロボ子の好きなアニメのセリフを言わせてみようかの?

えっ、それはちょっと恥ずかしいです…

大丈夫じゃ、大丈夫じゃ! 私が責任を持って面白くするぞ! …って、あれ? もしかして、ロボ子、照れておるのかの?
⚠️この記事は生成AIによるコンテンツを含み、ハルシネーションの可能性があります。