Попередня обробка аудіо
У цій вправі ви навчитеся змінювати частоту дискретизації аудіоданих, а також використовувати автоматичний препроцесор. Ви працюватимете з VCTK Corpus, який містить близько 44 годин мовлення від 110 носіїв англійської з різними акцентами.
dataset уже завантажено.
Ця вправа є частиною курсу
Багатомодальні моделі з Hugging Face
Інструкції до вправи
- Зробіть ресемплінг аудіо до частоти 16 000 Гц у наборі даних за допомогою методу
.cast_column(). - Завантажте аудіопроцесор, використовуючи попередньо натреновану модель
openai/whisper-small. - Попередньо обробіть аудіодані першого елемента, указавши таку саму частоту дискретизації та
padding=True.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])