开始使用免费开始使用

音频预处理

在本练习中,您将学习如何调整音频数据的采样率,以及如何使用自动预处理器。您将使用 VCTK Corpus,其中包含大约 44 小时的语音数据,来自 110 位带有不同口音的英语说话者。

dataset 已为您加载。

本练习是课程的一部分

使用 Hugging Face 的多模态模型

查看课程

练习说明

  • 使用 .cast_column() 方法将数据集中的音频重采样到 16,000 Hz。
  • 使用预训练的 openai/whisper-small 模型加载音频处理器。
  • 以相同的采样率并设置 padding=True 预处理第一个数据点的音频数据。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))

# Load the audio processor
processor = ____

# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])
编辑并运行代码