音频预处理
在本练习中,您将学习如何调整音频数据的采样率,以及如何使用自动预处理器。您将使用 VCTK Corpus,其中包含大约 44 小时的语音数据,来自 110 位带有不同口音的英语说话者。
dataset 已为您加载。
本练习是课程的一部分
使用 Hugging Face 的多模态模型
练习说明
- 使用
.cast_column()方法将数据集中的音频重采样到 16,000 Hz。 - 使用预训练的
openai/whisper-small模型加载音频处理器。 - 以相同的采样率并设置
padding=True预处理第一个数据点的音频数据。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])