शुरू करेंमुफ़्त में शुरू करें

Text-to-Speech मॉडल का फाइन-ट्यूनिंग

आप VCTK Corpus के साथ काम करेंगे, जिसमें लगभग 44 घंटे का स्पीच डेटा है, जिसे अलग-अलग उच्चारण वाले अंग्रेज़ी वक्ताओं ने बोला है, ताकि आप एक text-to-speech मॉडल को क्षेत्रीय उच्चारण दोहराने के लिए फाइन-ट्यून कर सकें.

dataset पहले से लोड और प्रीप्रोसेस किया जा चुका है, और SpeechT5ForTextToSpeech मॉड्यूल भी लोड है, साथ ही Seq2SeqTrainingArguments और Seq2SeqTrainer मॉड्यूल. एक डेटा कोलेटर (data_collator) पहले से परिभाषित है.

कृपया ट्रेनर कॉन्फ़िग पर .train() मेथड को कॉल न करें, क्योंकि इस वातावरण में यह कोड टाइम आउट हो जाएगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Hugging Face के साथ मल्टी-मोडल मॉडल्स

पाठ्यक्रम देखें

अभ्यास निर्देश

  • SpeechT5ForTextToSpeech का उपयोग करके microsoft/speecht5_tts प्रीट्रेंड मॉडल लोड करें.
  • Seq2SeqTrainingArguments का एक इंस्टेंस बनाएँ, जिसमें: gradient_accumulation_steps को 8, learning_rate को 0.00001, warmup_steps को 500, और max_steps को 4000 सेट करें.
  • नए ट्रेनिंग आर्ग्युमेंट्स, model, डेटा, और दिए गए processor के साथ ट्रेनर को कॉन्फ़िगर करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
कोड संपादित करें और चलाएँ