शुरू करेंमुफ़्त में शुरू करें

ऑडियो डीनॉइज़िंग

इस अभ्यास में, आप WHAM डेटासेट का डेटा उपयोग करेंगे, जो स्पीच को बैकग्राउंड शोर के साथ मिलाता है, ताकि आप शोर हटाकर किसी अलग आवाज़ में नई स्पीच जेनरेट कर सकें!

शोरयुक्त स्पीच का स्पेक्ट्रोग्राम

नई आवाज़ के example_speech ऐरे और speaker_embedding वेक्टर पहले से लोड हैं। प्रीप्रोसेसर (processor) और वोकोडर (vocoder) भी उपलब्ध हैं, साथ ही SpeechT5ForSpeechToSpeech मॉड्यूल। प्लॉटिंग में मदद के लिए make_spectrogram() फंक्शन दिया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Hugging Face के साथ मल्टी-मोडल मॉडल्स

पाठ्यक्रम देखें

अभ्यास निर्देश

  • SpeechT5ForSpeechToSpeech का pretrained मॉडल microsoft/speecht5_vc चेकपॉइंट से लोड करें.
  • example_speech को 16000 की sampling rate के साथ प्रीप्रोसेस करें.
  • डीनॉइज़ की हुई स्पीच .generate_speech() का उपयोग करके जेनरेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the SpeechT5ForSpeechToSpeech pretrained model
model = ____

# Preprocess the example speech
inputs = ____(audio=____, sampling_rate=____, return_tensors="pt")

# Generate the denoised speech
speech = ____

make_spectrogram(speech)
sf.write("speech.wav", speech.numpy(), samplerate=16000)
कोड संपादित करें और चलाएँ