ऑडियो डीनॉइज़िंग
इस अभ्यास में, आप WHAM डेटासेट का डेटा उपयोग करेंगे, जो स्पीच को बैकग्राउंड शोर के साथ मिलाता है, ताकि आप शोर हटाकर किसी अलग आवाज़ में नई स्पीच जेनरेट कर सकें!

नई आवाज़ के example_speech ऐरे और speaker_embedding वेक्टर पहले से लोड हैं। प्रीप्रोसेसर (processor) और वोकोडर (vocoder) भी उपलब्ध हैं, साथ ही SpeechT5ForSpeechToSpeech मॉड्यूल। प्लॉटिंग में मदद के लिए make_spectrogram() फंक्शन दिया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ मल्टी-मोडल मॉडल्स
अभ्यास निर्देश
SpeechT5ForSpeechToSpeechका pretrained मॉडलmicrosoft/speecht5_vcचेकपॉइंट से लोड करें.example_speechको16000की sampling rate के साथ प्रीप्रोसेस करें.- डीनॉइज़ की हुई स्पीच
.generate_speech()का उपयोग करके जेनरेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____
# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")
# Generate the denoised speech
speech = ____
make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)