Generarea unui nou discurs
E momentul să îți completezi stăpânirea modelelor audio de la Hugging Face! Vei folosi un model ajustat fin pentru a genera un discurs nou pornind de la o voce dată. Vei alege o voce din VCTK Corpus ca bază pentru noul audio.
dataset-ul și modelul SpeechT5ForTextToSpeech (model) au fost deja încărcate, iar o funcție make_spectogram() a fost pusă la dispoziție pentru a ajuta la reprezentarea grafică.
Acest exercițiu face parte din cursul
Modele Multi-Modale cu Hugging Face
Instrucțiuni pentru exercițiu
- Încarcă un eșantion de încorporare a vorbitorului de la indexul
5dindataset-ul de testare. - Generează discursul din textul procesat specificând
inputs,speaker_embeddingșivocoder.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)