BaşlayınÜcretsiz başlayın

Yeni konuşma üretme

Hugging Face ses modellerini kullanma becerini tamamlamanın zamanı geldi! İnce ayar yapılmış bir modeli kullanarak belirli bir ses için yeni konuşma üreteceksin. Yeni ses için temel olarak VCTK Corpus içinden bir ses seçeceksin.

dataset ve SpeechT5ForTextToSpeech modeli (model) zaten yüklendi ve görselleştirmeye yardımcı olması için bir make_spectogram() işlevi sağlandı.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • Test dataset'inin 5 indeksinden bir örnek konuşmacı gömmesini yükle.
  • inputs, speaker_embedding ve vocoder belirterek işlenmiş metinden konuşmayı üret.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

text = "Hi, welcome to your new voice."

# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)

inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")

# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)

make_spectrogram(speech)
Kodu Düzenle ve Çalıştır