CommencezCommencez gratuitement

Créer des intégrations vocales

Il est temps de coder un tableau audio en une intégration d'orateur! Les intégrations d'orateur contiennent des informations permettant de personnaliser l'audio généré pour une personne donnée et sont essentielles pour produire de l'audio ajusté avec précision.

Le modèle préentraîné spkrec-xvect-voxceleb (speaker_model) et le jeu de données VCTK (dataset) ont été chargés pour vous.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Complétez la définition de la fonction create_speaker_embedding() en calculant l'intégration brute à partir de waveform à l'aide de speaker_model.
  • Extrayez le tableau audio du point de données à l'indice 10 de dataset.
  • Calculez une intégration d'orateur à partir du tableau audio à l'aide de la fonction create_speaker_embedding().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

def create_speaker_embedding(waveform):
    with torch.no_grad():
        # Calculate the raw embedding from the speaker_model
        speaker_embeddings = ____.____(torch.tensor(____))
        
        speaker_embeddings = torch.nn.functional.normalize(speaker_embeddings, dim=2)
        speaker_embeddings = speaker_embeddings.squeeze().cpu().numpy()
    return speaker_embeddings

# Extract the audio array from the dataset
audio_array = dataset[10]["____"]["____"]

# Calculate the speaker_embedding from the datapoint
speaker_embedding = ____(____)
print(speaker_embedding.shape)
Modifier et exécuter le code