Předzpracování audia
V tomto cvičení se naučíš, jak upravit vzorkovací frekvenci zvukových dat a jak použít automatický předzpracovatel. Budeme pracovat s datasetem VCTK Corpus, který obsahuje přibližně 44 hodin řeči od 110 anglicky mluvících osob s různými přízvuky.
Dataset dataset je již načtený.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Převzorkuj audio v datasetu na frekvenci 16 000 Hz pomocí metody
.cast_column(). - Načti audio procesor s využitím předtrénovaného modelu
openai/whisper-small. - Předzpracuj zvuková data prvního záznamu – zadej stejnou vzorkovací frekvenci a nastav
padding=True.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])