Konuşma gömme vektörleri oluşturma
Bir ses dizisini konuşmacı gömme vektörüne dönüştürme zamanı! Konuşmacı gömme vektörleri, üretilen sesi belirli bir konuşmacıya göre kişiselleştirmeye yarayan bilgileri içerir ve ince ayarlı ses üretimi için kritik öneme sahiptir.
Önceden eğitilmiş spkrec-xvect-voxceleb modeli (speaker_model) ve VCTK veri kümesi (dataset) senin için yüklendi.
Bu egzersiz, kursun bir parçasıdır
Hugging Face ile Multi-Modal Modeller
Egzersiz talimatları
speaker_modelkullanarakwaveformüzerinden ham gömme vektörünü hesaplayarakcreate_speaker_embedding()fonksiyon tanımını tamamla.dataset'in10indeksindeki veri noktasından ses dizisini çıkar.create_speaker_embedding()fonksiyonunu kullanarak bu ses dizisinden bir konuşmacı gömme vektörü hesapla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
def create_speaker_embedding(waveform):
with torch.no_grad():
# Calculate the raw embedding from the speaker_model
speaker_embeddings = ____.____(torch.tensor(____))
speaker_embeddings = torch.nn.functional.normalize(speaker_embeddings, dim=2)
speaker_embeddings = speaker_embeddings.squeeze().cpu().numpy()
return speaker_embeddings
# Extract the audio array from the dataset
audio_array = dataset[10]["____"]["____"]
# Calculate the speaker_embedding from the datapoint
speaker_embedding = ____(____)
print(speaker_embedding.shape)