Przetwarzanie zbiorów danych audio
Rozwijasz aplikację do precyzyjnego rolnictwa – chcesz umożliwić rolnikom sterowanie maszynami za pomocą poleceń głosowych. System powinien rozpoznawać słowa kluczowe w komendach takich jak „Turn on the sprinkler irrigation system."
Skorzystasz ze zbioru danych do wykrywania słów kluczowych, zawierającego nagrania audio z takimi słowami jak „on". Przetwórz pliki audio tak, aby można było ich użyć z wstępnie wytrenowanym modelem Transformer!
Niektóre dane zostały wcześniej załadowane:
datasetzawiera przykładowy zbiór treningowy plików audio. Zawiera już podziałtrain, więc nie musisz go osobno wskazywać podczas pracy zdataset.AutoFeatureExtractorzostał zaimportowany ztransformers.modelma wartośćfacebook/wav2vec2-base.max_durationjest zdefiniowane jako 1 sekunda.
To ćwiczenie jest częścią kursu
Efektywne trenowanie modeli AI z PyTorch
Instrukcje do ćwiczenia
- Wczytaj wstępnie wytrenowany
feature_extractorza pomocą klasyAutoFeatureExtractor. - Ustaw
sampling_rate, korzystając z częstotliwości próbkowania zfeature_extractor. - Ustaw
max_lengthtablicaudio_arraysna podstawiemax_duration.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)