Prétraitement de l'audio
Dans cet exercice, vous verrez comment ajuster la fréquence d'échantillonnage de données audio et comment utiliser un préprocesseur automatique. Vous utiliserez le VCTK Corpus, qui comprend environ 44 heures de données de parole produites par 110 locuteurs et locutrices anglophones avec différents accents.
Le dataset a déjà été chargé.
Cette activité fait partie du cours
Modèles multimodaux avec Hugging Face
Instructions de l’exercice
- Rééchantillonnez l'audio à une fréquence de 16 000 Hz dans le jeu de données à l'aide de la méthode
.cast_column(). - Chargez le processeur audio à l'aide du modèle préentraîné
openai/whisper-small. - Prétraitez les données audio du premier point de données, en précisant la même fréquence d'échantillonnage et
padding=True.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])