CommencezCommencez gratuitement

Ajuster finement un modèle de synthèse vocale (text-to-speech)

Vous allez travailler avec le VCTK Corpus, qui comprend environ 44 heures de données vocales prononcées par des personnes anglophones avec divers accents, afin d'ajuster finement un modèle de synthèse vocale pour reproduire des accents régionaux.

Le dataset a déjà été chargé et prétraité, et le module SpeechT5ForTextToSpeech a été chargé, tout comme les modules Seq2SeqTrainingArguments et Seq2SeqTrainer. Un assembleur de données (data_collator) a été prédéfini.

Veuillez ne pas appeler la méthode .train() sur la configuration du formateur, car ce code expirera dans cet environnement.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Chargez le modèle préentraîné microsoft/speecht5_tts à l'aide de SpeechT5ForTextToSpeech.
  • Créez une instance de Seq2SeqTrainingArguments avec : gradient_accumulation_steps à 8, learning_rate à 0.00001, warmup_steps à 500 et max_steps à 4000.
  • Configurez l'entraîneur avec les nouveaux paramètres d'entraînement, ainsi que le model, les données et le processor fournis.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the text-to-speech pretrained model
model = ____.____(____)

# Configure the required training arguments
training_args = ____(output_dir="speecht5_finetuned_vctk_test",
    gradient_accumulation_steps=____, learning_rate=____, warmup_steps=____, max_steps=4000, label_names=["labels"],
    push_to_hub=False)

# Configure the trainer
trainer = ____(args=training_args, model=model, data_collator=data_collator,
    train_dataset=dataset["train"], eval_dataset=dataset["test"], tokenizer=processor)
Modifier et exécuter le code