नया स्पीच जनरेट करना
अब समय है कि आप Hugging Face के audio मॉडल्स के इस्तेमाल में अपनी पकड़ पक्की करें! आप किसी दिए गए voice के लिए fine-tuned मॉडल से नया स्पीच जनरेट करेंगे. नए audio के आधार के रूप में आप VCTK Corpus में से एक voice चुनेंगे.
dataset और SpeechT5ForTextToSpeech मॉडल (model) पहले से लोड हैं, और plotting में मदद के लिए make_spectogram() फंक्शन दिया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ मल्टी-मोडल मॉडल्स
अभ्यास निर्देश
- test
datasetके index5से एक sample speaker embedding लोड करें. - प्रोसेस किए गए टेक्स्ट से स्पीच जनरेट करें, जहाँ
inputs,speaker_embedding, औरvocoderको specify करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)