Generování nové řeči
Čas dovršit zvládnutí audio modelů z Hugging Face! Použiješ doladěný model k vygenerování nové řeči pro konkrétní hlas. Jako základ pro nové audio si vybereš hlas z datasetu VCTK Corpus.
dataset a model SpeechT5ForTextToSpeech (model) jsou už načtené a k dispozici máš také funkci make_spectogram(), která ti pomůže s vykreslením výsledků.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Načti ukázkový embedding mluvčího z indexu
5testovacíhodatasetu. - Vygeneruj řeč ze zpracovaného textu zadáním parametrů
inputs,speaker_embeddingavocoder.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)