Automatické rozpoznávání řeči
V tomto cvičení použiješ AI k automatickému přepisu zvuku na text! Budeš znovu pracovat s datovou sadou VCTK Corpus, která obsahuje přibližně 44 hodin řeči anglických mluvčích s různými přízvuky. Použiješ model Whisper tiny od OpenAI, který má pouhých 37M parametrů – jeho úkolem bude předzpracovat zvuková data z VCTK a vygenerovat odpovídající text.
Audio preprocessor (processor) je již načten, stejně jako modul WhisperForConditionalGeneration. Vzorový zvukový datový bod (sample) je také připraven.
Toto cvičení je součástí kurzu
Multi-Modal Models with Hugging Face
Pokyny k cvičení
- Načti předtrénovaný model
WhisperForConditionalGenerationpomocí checkpointuopenai/whisper-tiny. - Předzpracuj datový bod
samples požadovanou vzorkovací frekvencí16000. - Vygeneruj tokeny z modelu pomocí atributu
.input_featurespředzpracovaných vstupů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None
# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)
# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)