ÎncepețiÎncepe gratuit

Recunoaștere automată a vorbirii

În acest exercițiu, folosești AI pentru a transcrie automat audio în text! Vei lucra din nou cu VCTK Corpus, un set de date care include aproximativ 44 de ore de vorbire înregistrată de vorbitori de engleză cu diverse accente. Vei folosi modelul Whisper tiny de la OpenAI, care conține doar 37M de parametri, pentru a preprocesa datele audio VCTK și a genera textul corespunzător.

Preprocesorul audio (processor) a fost deja încărcat, la fel și modulul WhisperForConditionalGeneration. Un eșantion audio (sample) a fost deja încărcat.

Acest exercițiu face parte din cursul

Modele Multi-Modale cu Hugging Face

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă modelul preantrenat WhisperForConditionalGeneration folosind checkpoint-ul openai/whisper-tiny.
  • Preprocesează eșantionul sample cu rata de eșantionare necesară de 16000.
  • Generează token-urile din model folosind atributul .input_features al intrărilor preprocesate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Editează și rulează codul