शुरू करेंमुफ़्त में शुरू करें

स्पीच एम्बेडिंग बनाना

अब एक audio array को speaker embedding में एन्कोड करने का समय है! Speaker embeddings यह जानकारी रखती हैं कि दिए गए स्पीकर के अनुसार generated audio को कैसे personalize किया जाए, और fine-tuned audio जनरेट करने के लिए ये बेहद ज़रूरी होती हैं.

प्रशिक्षित spkrec-xvect-voxceleb मॉडल (speaker_model) और VCTK डेटासेट (dataset) आपके लिए लोड कर दिए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Hugging Face के साथ मल्टी-मोडल मॉडल्स

पाठ्यक्रम देखें

अभ्यास निर्देश

  • speaker_model का उपयोग करके waveform से raw एम्बेडिंग निकालते हुए create_speaker_embedding() फंक्शन की परिभाषा पूरी करें.
  • dataset के इंडेक्स 10 वाले डेटा पॉइंट से audio array निकालें.
  • create_speaker_embedding() फंक्शन का उपयोग करके उस audio array से एक speaker embedding 계산 करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def create_speaker_embedding(waveform):
    with torch.no_grad():
        # Calculate the raw embedding from the speaker_model
        speaker_embeddings = ____.____(torch.tensor(____))
        
        speaker_embeddings = torch.nn.functional.normalize(speaker_embeddings, dim=2)
        speaker_embeddings = speaker_embeddings.squeeze().cpu().numpy()
    return speaker_embeddings

# Extract the audio array from the dataset
audio_array = dataset[10]["____"]["____"]

# Calculate the speaker_embedding from the datapoint
speaker_embedding = ____(____)
print(speaker_embedding.shape)
कोड संपादित करें और चलाएँ