Fine-tuning modelu pro převod textu na řeč
Budeš pracovat s datasetem VCTK Corpus, který obsahuje přibližně 44 hodin řečových dat od anglicky mluvících lidí s různými přízvuky. Cílem je doladit model pro převod textu na řeč tak, aby dokázal napodobovat regionální přízvuky.
Proměnná dataset je již načtená a předzpracovaná. K dispozici máš také modul SpeechT5ForTextToSpeech a moduly Seq2SeqTrainingArguments a Seq2SeqTrainer. Datový kolektor (data_collator) je předem definovaný.
Nevolej prosím metodu .train() na konfiguraci trenéra — v tomto prostředí by kód překročil časový limit.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Načti předtrénovaný model
microsoft/speecht5_ttspomocíSpeechT5ForTextToSpeech. - Vytvoř instanci
Seq2SeqTrainingArgumentss těmito parametry:gradient_accumulation_stepsnastav na8,learning_ratena0.00001,warmup_stepsna500amax_stepsna4000. - Nakonfiguruj trenéra s novými trénovacími argumenty a zadanými hodnotami
model, dat aprocessor.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)