音频去噪
在本练习中,您将使用 WHAM 数据集中的数据。该数据集将语音与背景噪声混合。您的任务是生成使用不同音色、且已去除背景噪声的新语音!

新的音色对应的 example_speech 数组和 speaker_embedding 向量已加载完毕。预处理器(processor)和声码器(vocoder)也已就绪,同时还提供了 SpeechT5ForSpeechToSpeech 模块。我们还提供了 make_spectrogram() 函数,便于绘图。
本练习是课程的一部分
使用 Hugging Face 的多模态模型
练习说明
- 使用
microsoft/speecht5_vc检查点加载SpeechT5ForSpeechToSpeech预训练模型。 - 以采样率
16000预处理example_speech。 - 使用
.generate_speech()生成去噪后的语音。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)