Dostrajanie modelu text-to-speech
W tym ćwiczeniu użyjesz korpusu VCTK, który zawiera około 44 godzin nagrań mowy anglojęzycznych mówców z różnymi akcentami, aby dostroić model text-to-speech do odwzorowywania regionalnych akcentów.
Zbiór danych dataset został już wczytany i przetworzony. Moduł SpeechT5ForTextToSpeech oraz moduły Seq2SeqTrainingArguments i Seq2SeqTrainer są dostępne. Kolator danych (data_collator) został wcześniej zdefiniowany.
Nie wywołuj metody .train() na obiekcie trenera – wywołanie tego kodu w tym środowisku spowoduje przekroczenie limitu czasu.
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Wczytaj wstępnie wytrenowany model
microsoft/speecht5_ttsza pomocą klasySpeechT5ForTextToSpeech. - Utwórz instancję klasy
Seq2SeqTrainingArgumentsz następującymi parametrami:gradient_accumulation_stepsustawionym na8,learning_rateustawionym na0.00001,warmup_stepsustawionym na500orazmax_stepsustawionym na4000. - Skonfiguruj trenera, przekazując nowe argumenty treningowe oraz dostarczony
model, dane iprocessor.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)