開始使用免費開始

產生新的語音

來完成你在 Hugging Face 音訊模型上的實作吧!你將使用微調過的模型,為指定的聲音產生新的語音。你會從 VCTK Corpus 中挑選一個說話者作為新音訊的基準。

datasetSpeechT5ForTextToSpeech 模型(model)都已載入,同時也提供了 make_spectogram() 函式來協助繪圖。

本練習屬於課程

使用 Hugging Face 的多模態模型

檢視課程

練習說明

  • 從測試 dataset 的索引 5 載入一個說話者的嵌入向量(speaker embedding)。
  • 透過指定 inputsspeaker_embedding,以及 vocoder,從前處理後的文字產生語音。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
編輯並執行程式碼