Zacznij terazZacznij za darmo

Wstępne przetwarzanie dźwięku

W tym ćwiczeniu nauczysz się, jak dostosować częstotliwość próbkowania danych audio, a także jak korzystać z automatycznego preprocesora. Będziesz pracować z VCTK Corpus – zbiorem zawierającym około 44 godzin nagrań mowy 110 anglojęzycznych osób z różnymi akcentami.

Zmienna dataset została już wczytana.

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Przepróbkuj audio do częstotliwości 16 000 Hz w zbiorze danych, używając metody .cast_column().
  • Wczytaj procesor audio na podstawie wstępnie wytrenowanego modelu openai/whisper-small.
  • Wstępnie przetwórz dane audio pierwszego elementu, podając tę samą częstotliwość próbkowania oraz padding=True.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
Edytuj i uruchom kod