预处理音频数据集
您正在升级精准农业应用,使农户可以通过语音指令控制机械。系统应能识别指令中的关键词,例如 "Turn on the sprinkler irrigation system."。
您将利用一个关键词检索数据集,其中包含诸如 "on" 等关键词的音频片段。请预处理这些音频文件,以便与预训练的 Transformer 模型一起使用!
已预加载部分数据:
dataset包含一个音频文件的训练数据示例。它已经包含train切分,因此在使用dataset时无需再指定train。- 已从
transformers导入AutoFeatureExtractor。 model等于facebook/wav2vec2-base。max_duration被定义为 1 秒。
本练习是课程的一部分
使用 PyTorch 高效训练 AI 模型
练习说明
- 使用
AutoFeatureExtractor类加载一个预训练的feature_extractor。 - 使用
feature_extractor中的采样率设置sampling_rate。 - 使用
max_duration设置audio_arrays的max_length。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)