Yeni konuşma üretme
Hugging Face ses modellerini kullanma becerini tamamlamanın zamanı geldi! İnce ayar yapılmış bir modeli kullanarak belirli bir ses için yeni konuşma üreteceksin. Yeni ses için temel olarak VCTK Corpus içinden bir ses seçeceksin.
dataset ve SpeechT5ForTextToSpeech modeli (model) zaten yüklendi ve görselleştirmeye yardımcı olması için bir make_spectogram() işlevi sağlandı.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
- Test
dataset'inin5indeksinden bir örnek konuşmacı gömmesini yükle. inputs,speaker_embeddingvevocoderbelirterek işlenmiş metinden konuşmayı üret.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
text = "Hi, welcome to your new voice."
# Load a speaker embedding from the dataset
speaker_embedding = torch.tensor(dataset[5]["____"]).unsqueeze(0)
inputs = processor(text=text, return_tensors="pt")
vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
# Generate speech
speech = model.generate_speech(____["input_ids"], ____, ____=____)
make_spectrogram(speech)