शुरू करेंमुफ़्त में शुरू करें

नया स्पीच जनरेट करना

अब समय है कि आप Hugging Face के audio मॉडल्स के इस्तेमाल में अपनी पकड़ पक्की करें! आप किसी दिए गए voice के लिए fine-tuned मॉडल से नया स्पीच जनरेट करेंगे. नए audio के आधार के रूप में आप VCTK Corpus में से एक voice चुनेंगे.

dataset और SpeechT5ForTextToSpeech मॉडल (model) पहले से लोड हैं, और plotting में मदद के लिए make_spectogram() फंक्शन दिया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Hugging Face के साथ मल्टी-मोडल मॉडल्स

पाठ्यक्रम देखें

अभ्यास निर्देश

  • test dataset के index 5 से एक sample speaker embedding लोड करें.
  • प्रोसेस किए गए टेक्स्ट से स्पीच जनरेट करें, जहाँ inputs, speaker_embedding, और vocoder को specify करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
कोड संपादित करें और चलाएँ