Генерування нових мовленнєвих фрагментів
Час закріпити вміння працювати з аудіомоделями Hugging Face! Ви використаєте донавчену модель, щоб згенерувати нове мовлення для заданого голосу. Як основу для нового аудіо ви оберете голос із VCTK Corpus.
dataset і модель SpeechT5ForTextToSpeech (model) уже завантажено, а функцію make_spectogram() надано для побудови графіків.
Ця вправа є частиною курсу
Багатомодальні моделі з Hugging Face
Інструкції до вправи
- Завантажте вкладення мовця (speaker embedding) з індексу
5тестовогоdataset. - Згенеруйте мовлення з обробленого тексту, вказавши
inputs,speaker_embeddingіvocoder.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)