Preprocesarea datelor audio
În acest exercițiu, vei învăța cum să ajustezi rata de eșantionare a datelor audio și cum să folosești un preprocesor automat. Vei lucra cu VCTK Corpus, un set de date care conține aproximativ 44 de ore de vorbire înregistrată de 110 vorbitori de limbă engleză cu accente diferite.
dataset a fost deja încărcat.
Acest exercițiu face parte din cursul
Modele Multi-Modale cu Hugging Face
Instrucțiuni pentru exercițiu
- Reeșantionează sunetul la o frecvență de 16.000 Hz în setul de date, folosind metoda
.cast_column(). - Încarcă procesorul audio utilizând modelul preantrenat
openai/whisper-small. - Preprocesează datele audio ale primului punct de date, specificând aceeași rată de eșantionare și
padding=True.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])