生成新语音
是时候巩固您对 Hugging Face 音频模型的掌握了!您将使用一个微调后的模型,为指定的声音生成全新的语音。您会从 VCTK Corpus 中选择一个声音,作为新音频的基础。
dataset 和 SpeechT5ForTextToSpeech 模型(model)已加载完毕,并提供了 make_spectogram() 函数用于辅助绘图。
本练习是课程的一部分
使用 Hugging Face 的多模态模型
练习说明
- 从测试集
dataset的索引5处加载一个示例说话人嵌入。 - 通过指定
inputs、speaker_embedding和vocoder,从处理后的文本生成语音。
交互式实操练习
通过完成这段示例代码来试试这个练习。
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)