Предобработка аудионаборов данных
Вы улучшаете своё приложение для точного земледелия: теперь фермеры смогут управлять техникой с помощью голосовых команд. Система должна распознавать ключевые слова в таких командах, как «Turn on the sprinkler irrigation system».
Вы будете использовать набор данных для обнаружения ключевых слов, содержащий аудиозаписи отдельных слов, например «on». Выполните предобработку аудиофайлов, чтобы их можно было использовать с предобученной моделью Transformer!
Часть данных уже загружена:
datasetсодержит обучающую выборку аудиофайлов. Разбиениеtrainуже включено, поэтому указывать его при работе сdatasetне нужно.AutoFeatureExtractorимпортирован изtransformers.modelравенfacebook/wav2vec2-base.max_durationзадан как 1 секунда.
Это упражнение является частью курса
Эффективное обучение моделей ИИ с PyTorch
Инструкции к упражнению
- Загрузите предобученный
feature_extractorс помощью классаAutoFeatureExtractor. - Задайте
sampling_rate, используя частоту дискретизации изfeature_extractor. - Задайте
max_lengthдляaudio_arraysс помощьюmax_duration.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)