產生新的語音
來完成你在 Hugging Face 音訊模型上的實作吧!你將使用微調過的模型,為指定的聲音產生新的語音。你會從 VCTK Corpus 中挑選一個說話者作為新音訊的基準。
dataset 與 SpeechT5ForTextToSpeech 模型(model)都已載入,同時也提供了 make_spectogram() 函式來協助繪圖。
本練習屬於課程
使用 Hugging Face 的多模態模型
練習說明
- 從測試
dataset的索引5載入一個說話者的嵌入向量(speaker embedding)。 - 透過指定
inputs、speaker_embedding,以及vocoder,從前處理後的文字產生語音。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)