Wstępne przetwarzanie dźwięku
W tym ćwiczeniu nauczysz się, jak dostosować częstotliwość próbkowania danych audio, a także jak korzystać z automatycznego preprocesora. Będziesz pracować z VCTK Corpus – zbiorem zawierającym około 44 godzin nagrań mowy 110 anglojęzycznych osób z różnymi akcentami.
Zmienna dataset została już wczytana.
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Przepróbkuj audio do częstotliwości 16 000 Hz w zbiorze danych, używając metody
.cast_column(). - Wczytaj procesor audio na podstawie wstępnie wytrenowanego modelu
openai/whisper-small. - Wstępnie przetwórz dane audio pierwszego elementu, podając tę samą częstotliwość próbkowania oraz
padding=True.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])