ÎncepețiÎncepe gratuit

Preprocesarea datelor audio

În acest exercițiu, vei învăța cum să ajustezi rata de eșantionare a datelor audio și cum să folosești un preprocesor automat. Vei lucra cu VCTK Corpus, un set de date care conține aproximativ 44 de ore de vorbire înregistrată de 110 vorbitori de limbă engleză cu accente diferite.

dataset a fost deja încărcat.

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Reeșantionează sunetul la o frecvență de 16.000 Hz în setul de date, folosind metoda .cast_column().
  • Încarcă procesorul audio utilizând modelul preantrenat openai/whisper-small.
  • Preprocesează datele audio ale primului punct de date, specificând aceeași rată de eșantionare și padding=True.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
Editează și rulează codul