Generowanie nowej mowy
Czas dopełnić swoją wiedzę na temat korzystania z modeli audio Hugging Face! Użyjesz wytrenowanego modelu, aby wygenerować nową mowę dla wybranego głosu. Jako podstawę nowego nagrania wybierzesz głos z korpusu VCTK.
dataset oraz model SpeechT5ForTextToSpeech (model) zostały już załadowane, a do wizualizacji udostępniono funkcję make_spectogram().
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Załaduj przykładowe osadzenie mówcy (speaker embedding) z indeksu
5testowegodataset. - Wygeneruj mowę na podstawie przetworzonego tekstu, podając
inputs,speaker_embeddingorazvocoder.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)