BaşlayınÜcretsiz başlayın

Konuşma gömme vektörleri oluşturma

Bir ses dizisini konuşmacı gömme vektörüne dönüştürme zamanı! Konuşmacı gömme vektörleri, üretilen sesi belirli bir konuşmacıya göre kişiselleştirmeye yarayan bilgileri içerir ve ince ayarlı ses üretimi için kritik öneme sahiptir.

Önceden eğitilmiş spkrec-xvect-voxceleb modeli (speaker_model) ve VCTK veri kümesi (dataset) senin için yüklendi.

Bu egzersiz, kursun bir parçasıdır

Hugging Face ile Multi-Modal Modeller

Kursa Göz Atın

Egzersiz talimatları

  • speaker_model kullanarak waveform üzerinden ham gömme vektörünü hesaplayarak create_speaker_embedding() fonksiyon tanımını tamamla.
  • dataset'in 10 indeksindeki veri noktasından ses dizisini çıkar.
  • create_speaker_embedding() fonksiyonunu kullanarak bu ses dizisinden bir konuşmacı gömme vektörü hesapla.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

def create_speaker_embedding(waveform):
    with torch.no_grad():
        # Calculate the raw embedding from the speaker_model
        speaker_embeddings = ____.____(torch.tensor(____))
        
        speaker_embeddings = torch.nn.functional.normalize(speaker_embeddings, dim=2)
        speaker_embeddings = speaker_embeddings.squeeze().cpu().numpy()
    return speaker_embeddings

# Extract the audio array from the dataset
audio_array = dataset[10]["____"]["____"]

# Calculate the speaker_embedding from the datapoint
speaker_embedding = ____(____)
print(speaker_embedding.shape)
Kodu Düzenle ve Çalıştır