Khử nhiễu âm thanh
Trong bài tập này, bạn sẽ dùng dữ liệu từ bộ WHAM, nơi trộn lời nói với tiếng ồn nền, để tạo ra lời nói mới bằng một giọng khác và đã loại bỏ tiếng ồn nền!

Mảng example_speech và vector speaker_embedding của giọng nói mới đã được nạp sẵn. Bộ tiền xử lý (processor) và vocoder (vocoder) cũng đã sẵn sàng, cùng với mô-đun SpeechT5ForSpeechToSpeech. Hàm make_spectrogram() được cung cấp để hỗ trợ vẽ biểu đồ.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải mô hình pretrained
SpeechT5ForSpeechToSpeechvới checkpointmicrosoft/speecht5_vc. - Tiền xử lý
example_speechvới tần số lấy mẫu16000. - Tạo lời nói đã khử nhiễu bằng
.generate_speech().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)