Créer des intégrations vocales
Il est temps de coder un tableau audio en une intégration d'orateur! Les intégrations d'orateur contiennent des informations permettant de personnaliser l'audio généré pour une personne donnée et sont essentielles pour produire de l'audio ajusté avec précision.
Le modèle préentraîné spkrec-xvect-voxceleb (speaker_model) et le jeu de données VCTK (dataset) ont été chargés pour vous.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Complétez la définition de la fonction
create_speaker_embedding()en calculant l'intégration brute à partir dewaveformà l'aide despeaker_model. - Extrayez le tableau audio du point de données à l'indice
10dedataset. - Calculez une intégration d'orateur à partir du tableau audio à l'aide de la fonction
create_speaker_embedding().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def create_speaker_embedding(waveform):
with torch.no_grad():
# Calculate the raw embedding from the speaker_model
speaker_embeddings = ____.____(torch.tensor(____))
speaker_embeddings = torch.nn.functional.normalize(speaker_embeddings, dim=2)
speaker_embeddings = speaker_embeddings.squeeze().cpu().numpy()
return speaker_embeddings
# Extract the audio array from the dataset
audio_array = dataset[10]["____"]["____"]
# Calculate the speaker_embedding from the datapoint
speaker_embedding = ____(____)
print(speaker_embedding.shape)