开始使用免费开始使用

生成新语音

是时候巩固您对 Hugging Face 音频模型的掌握了!您将使用一个微调后的模型,为指定的声音生成全新的语音。您会从 VCTK Corpus 中选择一个声音,作为新音频的基础。

datasetSpeechT5ForTextToSpeech 模型(model)已加载完毕,并提供了 make_spectogram() 函数用于辅助绘图。

本练习是课程的一部分

使用 Hugging Face 的多模态模型

查看课程

练习说明

  • 从测试集 dataset 的索引 5 处加载一个示例说话人嵌入。
  • 通过指定 inputsspeaker_embeddingvocoder,从处理后的文本生成语音。

交互式实操练习

通过完成这段示例代码来试试这个练习。

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
编辑并运行代码