Preprocesarea seturilor de date audio
Îmbunătățești aplicația ta de agricultură de precizie prin adăugarea posibilității ca fermierii să controleze utilajele cu comenzi vocale. Sistemul trebuie să recunoască cuvinte-cheie din comenzi precum „Turn on the sprinkler irrigation system.”
Vei folosi un set de date de tip keyword spotting cu clipuri audio ale unor cuvinte-cheie, cum ar fi „on.” Preprocesează fișierele audio astfel încât să poată fi utilizate cu un model Transformer pre-antrenat!
Unele date au fost preîncărcate:
datasetconține un eșantion din setul de antrenament format din fișiere audio. Acesta include deja split-ultrain, deci nu trebuie să specificitraincând foloseștidataset.AutoFeatureExtractora fost importat dintransformers.modeleste egal cufacebook/wav2vec2-base.max_durationeste definit ca 1 secundă.
Acest exercițiu face parte din cursul
Antrenament eficient al modelelor AI cu PyTorch
Instrucțiuni pentru exercițiu
- Încarcă un
feature_extractorpre-antrenat folosind clasaAutoFeatureExtractor. - Setează
sampling_ratefolosind ratele dinfeature_extractor. - Setează
max_lengthalaudio_arraysfolosindmax_duration.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)