Reglajul fin al unui model text-to-speech
Vei lucra cu VCTK Corpus, un set de date care conține aproximativ 44 de ore de înregistrări vocale ale vorbitorilor de engleză cu diverse accente regionale, pentru a realiza reglajul fin al unui model text-to-speech capabil să reproducă aceste accente.
dataset a fost deja încărcat și preprocesat, iar modulul SpeechT5ForTextToSpeech a fost importat, la fel ca Seq2SeqTrainingArguments și Seq2SeqTrainer. Un data collator (data_collator) a fost predefinit.
Te rugăm să nu apelezi metoda .train() pe configurația trainerului, deoarece codul va expira în acest mediu.
Acest exercițiu face parte din cursul
Modele Multi-Modale cu Hugging Face
Instrucțiuni pentru exercițiu
- Încarcă modelul preantrenat
microsoft/speecht5_ttsfolosindSpeechT5ForTextToSpeech. - Creează o instanță a clasei
Seq2SeqTrainingArgumentscu:gradient_accumulation_stepssetat la8,learning_ratesetat la0.00001,warmup_stepssetat la500șimax_stepssetat la4000. - Configurează trainerul cu noile argumente de antrenare, precum și cu
model, datele șiprocessor-ul furnizate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)