ÎncepețiÎncepe gratuit

Preprocesarea seturilor de date audio

Îmbunătățești aplicația ta de agricultură de precizie prin adăugarea posibilității ca fermierii să controleze utilajele cu comenzi vocale. Sistemul trebuie să recunoască cuvinte-cheie din comenzi precum „Turn on the sprinkler irrigation system.”

Vei folosi un set de date de tip keyword spotting cu clipuri audio ale unor cuvinte-cheie, cum ar fi „on.” Preprocesează fișierele audio astfel încât să poată fi utilizate cu un model Transformer pre-antrenat!

Unele date au fost preîncărcate:

  • dataset conține un eșantion din setul de antrenament format din fișiere audio. Acesta include deja split-ul train, deci nu trebuie să specifici train când folosești dataset.
  • AutoFeatureExtractor a fost importat din transformers.
  • model este egal cu facebook/wav2vec2-base.
  • max_duration este definit ca 1 secundă.

Acest exercițiu face parte din cursul

Antrenament eficient al modelelor AI cu PyTorch

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă un feature_extractor pre-antrenat folosind clasa AutoFeatureExtractor.
  • Setează sampling_rate folosind ratele din feature_extractor.
  • Setează max_length al audio_arrays folosind max_duration.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
Editează și rulează codul