Začněte nyníZačněte zdarma

Předzpracování audia

V tomto cvičení se naučíš, jak upravit vzorkovací frekvenci zvukových dat a jak použít automatický předzpracovatel. Budeme pracovat s datasetem VCTK Corpus, který obsahuje přibližně 44 hodin řeči od 110 anglicky mluvících osob s různými přízvuky.

Dataset dataset je již načtený.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Převzorkuj audio v datasetu na frekvenci 16 000 Hz pomocí metody .cast_column().
  • Načti audio procesor s využitím předtrénovaného modelu openai/whisper-small.
  • Předzpracuj zvuková data prvního záznamu – zadej stejnou vzorkovací frekvenci a nastav padding=True.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
Upravit a spustit kód