Začněte nyníZačněte zdarma

Fine-tuning modelu pro převod textu na řeč

Budeš pracovat s datasetem VCTK Corpus, který obsahuje přibližně 44 hodin řečových dat od anglicky mluvících lidí s různými přízvuky. Cílem je doladit model pro převod textu na řeč tak, aby dokázal napodobovat regionální přízvuky.

Proměnná dataset je již načtená a předzpracovaná. K dispozici máš také modul SpeechT5ForTextToSpeech a moduly Seq2SeqTrainingArguments a Seq2SeqTrainer. Datový kolektor (data_collator) je předem definovaný.

Nevolej prosím metodu .train() na konfiguraci trenéra — v tomto prostředí by kód překročil časový limit.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Načti předtrénovaný model microsoft/speecht5_tts pomocí SpeechT5ForTextToSpeech.
  • Vytvoř instanci Seq2SeqTrainingArguments s těmito parametry: gradient_accumulation_steps nastav na 8, learning_rate na 0.00001, warmup_steps na 500 a max_steps na 4000.
  • Nakonfiguruj trenéra s novými trénovacími argumenty a zadanými hodnotami model, dat a processor.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
Upravit a spustit kód