开始使用免费开始使用

音频去噪

在本练习中,您将使用 WHAM 数据集中的数据。该数据集将语音与背景噪声混合。您的任务是生成使用不同音色、且已去除背景噪声的新语音!

有噪语音的声谱图

新的音色对应的 example_speech 数组和 speaker_embedding 向量已加载完毕。预处理器(processor)和声码器(vocoder)也已就绪,同时还提供了 SpeechT5ForSpeechToSpeech 模块。我们还提供了 make_spectrogram() 函数,便于绘图。

本练习是课程的一部分

使用 Hugging Face 的多模态模型

查看课程

练习说明

  • 使用 microsoft/speecht5_vc 检查点加载 SpeechT5ForSpeechToSpeech 预训练模型。
  • 以采样率 16000 预处理 example_speech
  • 使用 .generate_speech() 生成去噪后的语音。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
编辑并运行代码