Тонке налаштування моделі перетворення тексту на мовлення
Ви працюватимете з VCTK Corpus, який містить близько 44 годин мовних даних, начитаних англомовними дикторами з різними акцентами, щоб виконати тонке налаштування моделі перетворення тексту на мовлення для відтворення регіональних акцентів.
dataset уже завантажено та попередньо оброблено, модуль SpeechT5ForTextToSpeech завантажено, так само як і модулі Seq2SeqTrainingArguments і Seq2SeqTrainer. Колатор даних (data_collator) попередньо визначено.
Будь ласка, не викликайте метод .train() у конфігурації тренера, оскільки цей код перевищить ліміт часу в цьому середовищі.
Ця вправа є частиною курсу
Багатомодальні моделі з Hugging Face
Інструкції до вправи
- Завантажте попередньо натреновану модель
microsoft/speecht5_ttsза допомогоюSpeechT5ForTextToSpeech. - Створіть екземпляр
Seq2SeqTrainingArgumentsіз такими параметрами:gradient_accumulation_stepsдорівнює8,learning_rateдорівнює0.00001,warmup_stepsдорівнює500, аmax_stepsдорівнює4000. - Налаштуйте тренер з новими параметрами навчання, а також з наданими
model, даними таprocessor.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)