开始使用免费开始使用

微调文本转语音模型

您将使用 VCTK Corpus,该数据集包含约 44 小时由不同口音的英语母语者录制的语音数据,用于微调文本转语音模型以复刻区域口音。

dataset 已加载并完成预处理,SpeechT5ForTextToSpeech 模块以及 Seq2SeqTrainingArgumentsSeq2SeqTrainer 模块也已加载。数据整理器(data_collator)已预定义。

请不要在训练器配置上调用 .train() 方法,本环境中运行会超时。

本练习是课程的一部分

使用 Hugging Face 的多模态模型

查看课程

练习说明

  • 使用 SpeechT5ForTextToSpeech 加载 microsoft/speecht5_tts 预训练模型。
  • 创建 Seq2SeqTrainingArguments 实例,并设置:gradient_accumulation_steps8learning_rate0.00001warmup_steps500max_steps4000
  • 使用新的训练参数配置训练器,并传入提供的 model、数据和 processor

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
编辑并运行代码