ПочатиПочніть безкоштовно

Генерування нових мовленнєвих фрагментів

Час закріпити вміння працювати з аудіомоделями Hugging Face! Ви використаєте донавчену модель, щоб згенерувати нове мовлення для заданого голосу. Як основу для нового аудіо ви оберете голос із VCTK Corpus.

dataset і модель SpeechT5ForTextToSpeech (model) уже завантажено, а функцію make_spectogram() надано для побудови графіків.

Ця вправа є частиною курсу

Багатомодальні моделі з Hugging Face

Переглянути курс

Інструкції до вправи

  • Завантажте вкладення мовця (speaker embedding) з індексу 5 тестового dataset.
  • Згенеруйте мовлення з обробленого тексту, вказавши inputs, speaker_embedding і vocoder.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Редагувати та запускати код