Automatyczne rozpoznawanie mowy
W tym ćwiczeniu wykorzystasz sztuczną inteligencję do automatycznej transkrypcji mowy na tekst! Pracujesz z korpusem VCTK, który zawiera około 44 godzin nagrań mowy anglojęzycznych osób z różnymi akcentami. Użyjesz modelu Whisper tiny od OpenAI – zawiera on zaledwie 37 mln parametrów – aby wstępnie przetworzyć dane audio z VCTK i wygenerować odpowiadający im tekst.
Preprocesor audio (processor) został już załadowany, podobnie jak moduł WhisperForConditionalGeneration. Przykładowy punkt danych audio (sample) jest również gotowy do użycia.
To ćwiczenie jest częścią kursu
Modele multimodalne z Hugging Face
Instrukcje do ćwiczenia
- Załaduj wstępnie wytrenowany model
WhisperForConditionalGeneration, korzystając z checkpointuopenai/whisper-tiny. - Wstępnie przetwórz punkt danych
sample, używając wymaganej częstotliwości próbkowania16000. - Wygeneruj tokeny z modelu, używając atrybutu
.input_featureswstępnie przetworzonych danych wejściowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None
# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)
# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)