Zacznij terazZacznij za darmo

Dostrajanie modelu text-to-speech

W tym ćwiczeniu użyjesz korpusu VCTK, który zawiera około 44 godzin nagrań mowy anglojęzycznych mówców z różnymi akcentami, aby dostroić model text-to-speech do odwzorowywania regionalnych akcentów.

Zbiór danych dataset został już wczytany i przetworzony. Moduł SpeechT5ForTextToSpeech oraz moduły Seq2SeqTrainingArguments i Seq2SeqTrainer są dostępne. Kolator danych (data_collator) został wcześniej zdefiniowany.

Nie wywołuj metody .train() na obiekcie trenera – wywołanie tego kodu w tym środowisku spowoduje przekroczenie limitu czasu.

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj wstępnie wytrenowany model microsoft/speecht5_tts za pomocą klasy SpeechT5ForTextToSpeech.
  • Utwórz instancję klasy Seq2SeqTrainingArguments z następującymi parametrami: gradient_accumulation_steps ustawionym na 8, learning_rate ustawionym na 0.00001, warmup_steps ustawionym na 500 oraz max_steps ustawionym na 4000.
  • Skonfiguruj trenera, przekazując nowe argumenty treningowe oraz dostarczony model, dane i processor.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
Edytuj i uruchom kod