Förbehandla ljuddatamängder
Du bygger vidare på din precisionslandsbruksapplikation och lägger till stöd för röststyrning, så att lantbrukare kan kontrollera sina maskiner med röstkommandon. Systemet ska känna igen nyckelord i kommandon som "Turn on the sprinkler irrigation system."
Du kommer att använda en datamängd för nyckelordsigenkänning med ljudklipp av nyckelord som "on." Förbehandla ljudfilerna så att de kan användas med en förtränad Transformer-modell!
En del data har redan laddats in:
datasetinnehåller ett urval av träningsdata med ljudfiler. Det innehåller redan uppdelningentrain, så du behöver inte angetrainnär du använderdataset.AutoFeatureExtractorhar importerats fråntransformers.modelär satt tillfacebook/wav2vec2-base.max_durationär definierad som 1 sekund.
Den här övningen är en del av kursen
Effektiv AI-modellträning med PyTorch
Övningsinstruktioner
- Läs in en förtränad
feature_extractormed klassenAutoFeatureExtractor. - Ange
sampling_ratemed samplingsfrekvensen frånfeature_extractor. - Ange
max_lengthföraudio_arraysmed hjälp avmax_duration.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)