Générer une nouvelle parole
Il est temps de parfaire votre maîtrise des modèles audio de Hugging Face! Vous allez utiliser un modèle ajusté finement pour générer une nouvelle parole à partir d'une voix donnée. Vous choisirez une voix du corpus VCTK comme base du nouvel audio.
Le dataset et le modèle SpeechT5ForTextToSpeech (model) ont déjà été chargés, et une fonction make_spectogram() est fournie pour vous aider à tracer les graphiques.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Chargez un échantillon d'« speaker embedding » à l'indice
5dudatasetde test. - Générez la parole à partir du texte traité en précisant
inputs,speaker_embeddingetvocoder.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)