Попередня обробка аудіонаборів даних
Ви вдосконалюєте застосунок для точного землеробства, додаючи можливість керувати технікою голосовими командами. Система має розпізнавати ключові слова в командах на кшталт «Увімкни систему дощування».
Ви скористаєтеся набором даних для виявлення ключових слів з аудіофрагментами слів, наприклад «on». Виконайте попередню обробку аудіофайлів, щоб їх можна було використати з попередньо натренованою моделлю Transformer!
Деякі дані вже завантажено:
datasetмістить зразок тренувального набору аудіофайлів. Він уже має розбиттяtrain, тож вам не потрібно вказуватиtrain, коли ви використовуєтеdataset.AutoFeatureExtractorімпортовано зtransformers.modelдорівнюєfacebook/wav2vec2-base.max_durationвизначено як 1 секунда.
Ця вправа є частиною курсу
Ефективне тренування моделей ШІ з PyTorch
Інструкції до вправи
- Завантажте попередньо натренований
feature_extractorза допомогою класуAutoFeatureExtractor. - Встановіть
sampling_rate, використовуючи частоти зfeature_extractor. - Задайте
max_lengthдляaudio_arrays, використовуючиmax_duration.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)