Zacznij terazZacznij za darmo

Przetwarzanie zbiorów danych audio

Rozwijasz aplikację do precyzyjnego rolnictwa – chcesz umożliwić rolnikom sterowanie maszynami za pomocą poleceń głosowych. System powinien rozpoznawać słowa kluczowe w komendach takich jak „Turn on the sprinkler irrigation system."

Skorzystasz ze zbioru danych do wykrywania słów kluczowych, zawierającego nagrania audio z takimi słowami jak „on". Przetwórz pliki audio tak, aby można było ich użyć z wstępnie wytrenowanym modelem Transformer!

Niektóre dane zostały wcześniej załadowane:

  • dataset zawiera przykładowy zbiór treningowy plików audio. Zawiera już podział train, więc nie musisz go osobno wskazywać podczas pracy z dataset.
  • AutoFeatureExtractor został zaimportowany z transformers.
  • model ma wartość facebook/wav2vec2-base.
  • max_duration jest zdefiniowane jako 1 sekunda.

To ćwiczenie jest częścią kursu

Efektywne trenowanie modeli AI z PyTorch

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj wstępnie wytrenowany feature_extractor za pomocą klasy AutoFeatureExtractor.
  • Ustaw sampling_rate, korzystając z częstotliwości próbkowania z feature_extractor.
  • Ustaw max_length tablic audio_arrays na podstawie max_duration.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
Edytuj i uruchom kod