Text-to-Speech मॉडल का फाइन-ट्यूनिंग
आप VCTK Corpus के साथ काम करेंगे, जिसमें लगभग 44 घंटे का स्पीच डेटा है, जिसे अलग-अलग उच्चारण वाले अंग्रेज़ी वक्ताओं ने बोला है, ताकि आप एक text-to-speech मॉडल को क्षेत्रीय उच्चारण दोहराने के लिए फाइन-ट्यून कर सकें.
dataset पहले से लोड और प्रीप्रोसेस किया जा चुका है, और SpeechT5ForTextToSpeech मॉड्यूल भी लोड है, साथ ही Seq2SeqTrainingArguments और Seq2SeqTrainer मॉड्यूल. एक डेटा कोलेटर (data_collator) पहले से परिभाषित है.
कृपया ट्रेनर कॉन्फ़िग पर .train() मेथड को कॉल न करें, क्योंकि इस वातावरण में यह कोड टाइम आउट हो जाएगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ मल्टी-मोडल मॉडल्स
अभ्यास निर्देश
SpeechT5ForTextToSpeechका उपयोग करकेmicrosoft/speecht5_ttsप्रीट्रेंड मॉडल लोड करें.Seq2SeqTrainingArgumentsका एक इंस्टेंस बनाएँ, जिसमें:gradient_accumulation_stepsको8,learning_rateको0.00001,warmup_stepsको500, औरmax_stepsको4000सेट करें.- नए ट्रेनिंग आर्ग्युमेंट्स,
model, डेटा, और दिए गएprocessorके साथ ट्रेनर को कॉन्फ़िगर करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)