开始使用免费开始使用

预处理音频数据集

您正在升级精准农业应用,使农户可以通过语音指令控制机械。系统应能识别指令中的关键词,例如 "Turn on the sprinkler irrigation system."。

您将利用一个关键词检索数据集,其中包含诸如 "on" 等关键词的音频片段。请预处理这些音频文件,以便与预训练的 Transformer 模型一起使用!

已预加载部分数据:

  • dataset 包含一个音频文件的训练数据示例。它已经包含 train 切分,因此在使用 dataset 时无需再指定 train
  • 已从 transformers 导入 AutoFeatureExtractor
  • model 等于 facebook/wav2vec2-base
  • max_duration 被定义为 1 秒。

本练习是课程的一部分

使用 PyTorch 高效训练 AI 模型

查看课程

练习说明

  • 使用 AutoFeatureExtractor 类加载一个预训练的 feature_extractor
  • 使用 feature_extractor 中的采样率设置 sampling_rate
  • 使用 max_duration 设置 audio_arraysmax_length

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
编辑并运行代码