Kom igångKom igång gratis

Förbehandla ljuddatamängder

Du bygger vidare på din precisionslandsbruksapplikation och lägger till stöd för röststyrning, så att lantbrukare kan kontrollera sina maskiner med röstkommandon. Systemet ska känna igen nyckelord i kommandon som "Turn on the sprinkler irrigation system."

Du kommer att använda en datamängd för nyckelordsigenkänning med ljudklipp av nyckelord som "on." Förbehandla ljudfilerna så att de kan användas med en förtränad Transformer-modell!

En del data har redan laddats in:

  • dataset innehåller ett urval av träningsdata med ljudfiler. Det innehåller redan uppdelningen train, så du behöver inte ange train när du använder dataset.
  • AutoFeatureExtractor har importerats från transformers.
  • model är satt till facebook/wav2vec2-base.
  • max_duration är definierad som 1 sekund.

Den här övningen är en del av kursen

Effektiv AI-modellträning med PyTorch

Visa kurs

Övningsinstruktioner

  • Läs in en förtränad feature_extractor med klassen AutoFeatureExtractor.
  • Ange sampling_rate med samplingsfrekvensen från feature_extractor.
  • Ange max_length för audio_arrays med hjälp av max_duration.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
Redigera och kör kod