Fine-tune mô hình text-to-speech
Bạn sẽ làm việc với VCTK Corpus, bộ dữ liệu gồm khoảng 44 giờ âm thanh do người nói tiếng Anh với nhiều giọng vùng miền khác nhau, để fine-tune một mô hình text-to-speech nhằm tái tạo các giọng vùng miền.
dataset đã được tải và tiền xử lý, mô-đun SpeechT5ForTextToSpeech đã được tải, cùng với các mô-đun Seq2SeqTrainingArguments và Seq2SeqTrainer. Một data collator (data_collator) đã được định nghĩa sẵn.
Vui lòng không gọi phương thức .train() trên cấu hình trainer, vì đoạn mã này sẽ hết thời gian chạy trong môi trường này.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải mô hình pretrained
microsoft/speecht5_ttsbằngSpeechT5ForTextToSpeech. - Tạo một instance
Seq2SeqTrainingArgumentsvới:gradient_accumulation_stepsđặt là8,learning_rateđặt là0.00001,warmup_stepsđặt là500, vàmax_stepsđặt là4000. - Cấu hình trainer với bộ tham số huấn luyện mới, cùng
model, dữ liệu, vàprocessorđã cung cấp.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)