CommencezCommencez gratuitement

Prétraitement de l'audio

Dans cet exercice, vous verrez comment ajuster la fréquence d'échantillonnage de données audio et comment utiliser un préprocesseur automatique. Vous utiliserez le VCTK Corpus, qui comprend environ 44 heures de données de parole produites par 110 locuteurs et locutrices anglophones avec différents accents.

Le dataset a déjà été chargé.

Cette activité fait partie du cours

Modèles multimodaux avec Hugging Face

Voir le cours

Instructions de l’exercice

  • Rééchantillonnez l'audio à une fréquence de 16 000 Hz dans le jeu de données à l'aide de la méthode .cast_column().
  • Chargez le processeur audio à l'aide du modèle préentraîné openai/whisper-small.
  • Prétraitez les données audio du premier point de données, en précisant la même fréquence d'échantillonnage et padding=True.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
Modifier et exécuter le code