Začněte nyníZačněte zdarma

Generování nové řeči

Čas dovršit zvládnutí audio modelů z Hugging Face! Použiješ doladěný model k vygenerování nové řeči pro konkrétní hlas. Jako základ pro nové audio si vybereš hlas z datasetu VCTK Corpus.

dataset a model SpeechT5ForTextToSpeech (model) jsou už načtené a k dispozici máš také funkci make_spectogram(), která ti pomůže s vykreslením výsledků.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Načti ukázkový embedding mluvčího z indexu 5 testovacího datasetu.
  • Vygeneruj řeč ze zpracovaného textu zadáním parametrů inputs, speaker_embedding a vocoder.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Upravit a spustit kód