Автоматичне розпізнавання мовлення
У цій вправі ви використаєте ШІ, щоб автоматично транскрибувати аудіо в текст! Ви знову працюватимете з VCTK Corpus, який містить близько 44 годин мовлення англійською з різними accents. Ви використаєте найменшу модель Whisper від OpenAI — tiny, що має лише 37 млн параметрів, щоб виконати попередню обробку аудіоданих VCTK і згенерувати відповідний текст.
Аудіопроцесор (processor) уже завантажено, як і модуль WhisperForConditionalGeneration. Зразок аудіоданих (sample) також уже підготовлено.
Ця вправа є частиною курсу
Багатомодальні моделі з Hugging Face
Інструкції до вправи
- Завантажте попередньо натреновану модель
WhisperForConditionalGenerationз контрольної точкиopenai/whisper-tiny. - Виконайте попередню обробку зразка
sampleз потрібною частотою дискретизації16000. - Згенеруйте токени з моделі, використовуючи атрибут
.input_featuresпопередньо оброблених вхідних даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None
# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)
# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)