Bắt đầu ngayBắt đầu miễn phí

Khử nhiễu âm thanh

Trong bài tập này, bạn sẽ dùng dữ liệu từ bộ WHAM, nơi trộn lời nói với tiếng ồn nền, để tạo ra lời nói mới bằng một giọng khác và đã loại bỏ tiếng ồn nền!

Spectrogram of noisy speech

Mảng example_speech và vector speaker_embedding của giọng nói mới đã được nạp sẵn. Bộ tiền xử lý (processor) và vocoder (vocoder) cũng đã sẵn sàng, cùng với mô-đun SpeechT5ForSpeechToSpeech. Hàm make_spectrogram() được cung cấp để hỗ trợ vẽ biểu đồ.

Bài tập này là một phần của khóa học

Mô hình đa phương thức với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Tải mô hình pretrained SpeechT5ForSpeechToSpeech với checkpoint microsoft/speecht5_vc.
  • Tiền xử lý example_speech với tần số lấy mẫu 16000.
  • Tạo lời nói đã khử nhiễu bằng .generate_speech().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
Chỉnh sửa và Chạy Mã