微调文本转语音模型
您将使用 VCTK Corpus,该数据集包含约 44 小时由不同口音的英语母语者录制的语音数据,用于微调文本转语音模型以复刻区域口音。
dataset 已加载并完成预处理,SpeechT5ForTextToSpeech 模块以及 Seq2SeqTrainingArguments 和 Seq2SeqTrainer 模块也已加载。数据整理器(data_collator)已预定义。
请不要在训练器配置上调用 .train() 方法,本环境中运行会超时。
本练习是课程的一部分
使用 Hugging Face 的多模态模型
练习说明
- 使用
SpeechT5ForTextToSpeech加载microsoft/speecht5_tts预训练模型。 - 创建
Seq2SeqTrainingArguments实例,并设置:gradient_accumulation_steps为8,learning_rate为0.00001,warmup_steps为500,max_steps为4000。 - 使用新的训练参数配置训练器,并传入提供的
model、数据和processor。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)