ПочатиПочніть безкоштовно

Автоматичне розпізнавання мовлення

У цій вправі ви використаєте ШІ, щоб автоматично транскрибувати аудіо в текст! Ви знову працюватимете з VCTK Corpus, який містить близько 44 годин мовлення англійською з різними accents. Ви використаєте найменшу модель Whisper від OpenAI — tiny, що має лише 37 млн параметрів, щоб виконати попередню обробку аудіоданих VCTK і згенерувати відповідний текст.

Аудіопроцесор (processor) уже завантажено, як і модуль WhisperForConditionalGeneration. Зразок аудіоданих (sample) також уже підготовлено.

Ця вправа є частиною курсу

Багатомодальні моделі з Hugging Face

Переглянути курс

Інструкції до вправи

  • Завантажте попередньо натреновану модель WhisperForConditionalGeneration з контрольної точки openai/whisper-tiny.
  • Виконайте попередню обробку зразка sample з потрібною частотою дискретизації 16000.
  • Згенеруйте токени з моделі, використовуючи атрибут .input_features попередньо оброблених вхідних даних.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
Редагувати та запускати код