Zacznij terazZacznij za darmo

Automatyczne rozpoznawanie mowy

W tym ćwiczeniu wykorzystasz sztuczną inteligencję do automatycznej transkrypcji mowy na tekst! Pracujesz z korpusem VCTK, który zawiera około 44 godzin nagrań mowy anglojęzycznych osób z różnymi akcentami. Użyjesz modelu Whisper tiny od OpenAI – zawiera on zaledwie 37 mln parametrów – aby wstępnie przetworzyć dane audio z VCTK i wygenerować odpowiadający im tekst.

Preprocesor audio (processor) został już załadowany, podobnie jak moduł WhisperForConditionalGeneration. Przykładowy punkt danych audio (sample) jest również gotowy do użycia.

To ćwiczenie jest częścią kursu

Modele multimodalne z Hugging Face

Zobacz kurs

Instrukcje do ćwiczenia

  • Załaduj wstępnie wytrenowany model WhisperForConditionalGeneration, korzystając z checkpointu openai/whisper-tiny.
  • Wstępnie przetwórz punkt danych sample, używając wymaganej częstotliwości próbkowania 16000.
  • Wygeneruj tokeny z modelu, używając atrybutu .input_features wstępnie przetworzonych danych wejściowych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Edytuj i uruchom kod