Zacznij terazZacznij za darmo

Generowanie nowej mowy

Czas dopełnić swoją wiedzę na temat korzystania z modeli audio Hugging Face! Użyjesz wytrenowanego modelu, aby wygenerować nową mowę dla wybranego głosu. Jako podstawę nowego nagrania wybierzesz głos z korpusu VCTK.

dataset oraz model SpeechT5ForTextToSpeech (model) zostały już załadowane, a do wizualizacji udostępniono funkcję make_spectogram().

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Załaduj przykładowe osadzenie mówcy (speaker embedding) z indeksu 5 testowego dataset.
  • Wygeneruj mowę na podstawie przetworzonego tekstu, podając inputs, speaker_embedding oraz vocoder.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Edytuj i uruchom kod