ÎncepețiÎncepe gratuit

Generarea unui nou discurs

E momentul să îți completezi stăpânirea modelelor audio de la Hugging Face! Vei folosi un model ajustat fin pentru a genera un discurs nou pornind de la o voce dată. Vei alege o voce din VCTK Corpus ca bază pentru noul audio.

dataset-ul și modelul SpeechT5ForTextToSpeech (model) au fost deja încărcate, iar o funcție make_spectogram() a fost pusă la dispoziție pentru a ajuta la reprezentarea grafică.

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă un eșantion de încorporare a vorbitorului de la indexul 5 din dataset-ul de testare.
  • Generează discursul din textul procesat specificând inputs, speaker_embedding și vocoder.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Editează și rulează codul