Ajuster finement un modèle de synthèse vocale (text-to-speech)
Vous allez travailler avec le VCTK Corpus, qui comprend environ 44 heures de données vocales prononcées par des personnes anglophones avec divers accents, afin d'ajuster finement un modèle de synthèse vocale pour reproduire des accents régionaux.
Le dataset a déjà été chargé et prétraité, et le module SpeechT5ForTextToSpeech a été chargé, tout comme les modules Seq2SeqTrainingArguments et Seq2SeqTrainer. Un assembleur de données (data_collator) a été prédéfini.
Veuillez ne pas appeler la méthode .train() sur la configuration du formateur, car ce code expirera dans cet environnement.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Chargez le modèle préentraîné
microsoft/speecht5_ttsà l'aide deSpeechT5ForTextToSpeech. - Créez une instance de
Seq2SeqTrainingArgumentsavec :gradient_accumulation_stepsà8,learning_rateà0.00001,warmup_stepsà500etmax_stepsà4000. - Configurez l'entraîneur avec les nouveaux paramètres d'entraînement, ainsi que le
model, les données et leprocessorfournis.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the text-to-speech pretrained model
model = ____.____(____)
# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
push_to_hub=False)
# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)