CommencezCommencez gratuitement

Générer une nouvelle parole

Il est temps de parfaire votre maîtrise des modèles audio de Hugging Face! Vous allez utiliser un modèle ajusté finement pour générer une nouvelle parole à partir d'une voix donnée. Vous choisirez une voix du corpus VCTK comme base du nouvel audio.

Le dataset et le modèle SpeechT5ForTextToSpeech (model) ont déjà été chargés, et une fonction make_spectogram() est fournie pour vous aider à tracer les graphiques.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Chargez un échantillon d'« speaker embedding » à l'indice 5 du dataset de test.
  • Générez la parole à partir du texte traité en précisant inputs, speaker_embedding et vocoder.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Modifier et exécuter le code