Začněte nyníZačněte zdarma

Automatické rozpoznávání řeči

V tomto cvičení použiješ AI k automatickému přepisu zvuku na text! Budeš znovu pracovat s datovou sadou VCTK Corpus, která obsahuje přibližně 44 hodin řeči anglických mluvčích s různými přízvuky. Použiješ model Whisper tiny od OpenAI, který má pouhých 37M parametrů – jeho úkolem bude předzpracovat zvuková data z VCTK a vygenerovat odpovídající text.

Audio preprocessor (processor) je již načten, stejně jako modul WhisperForConditionalGeneration. Vzorový zvukový datový bod (sample) je také připraven.

Toto cvičení je součástí kurzu

Multi-Modal Models with Hugging Face

Zobrazit kurz

Pokyny k cvičení

  • Načti předtrénovaný model WhisperForConditionalGeneration pomocí checkpointu openai/whisper-tiny.
  • Předzpracuj datový bod sample s požadovanou vzorkovací frekvencí 16000.
  • Vygeneruj tokeny z modelu pomocí atributu .input_features předzpracovaných vstupů.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Upravit a spustit kód