新しい音声を生成する
Hugging Face の音声モデルを使いこなす総仕上げです!微調整済みモデルを使って、指定した話者の声で新しい音声を生成します。新しい音声のベースとなる話者は、VCTK Corpus から選びます。
dataset と SpeechT5ForTextToSpeech モデル(model)はすでに読み込まれており、プロット用の make_spectogram() 関数も用意されています。
この演習はコースの一部です
Hugging Face で学ぶマルチモーダルモデル
演習の手順
- テスト用
datasetのインデックス5から、サンプルの話者埋め込みを読み込みます。 - 処理済みテキストから音声を生成します。
inputs、speaker_embedding、およびvocoderを指定してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)