शुरू करेंमुफ़्त में शुरू करें

ऑटोमैटिक स्पीच रिकग्निशन

इस अभ्यास में, आप AI की मदद से ऑडियो को अपने-आप टेक्स्ट में ट्रांसक्राइब करेंगे! आप फिर से VCTK Corpus के साथ काम करेंगे, जिसमें अलग-अलग उच्चारण वाले अंग्रेज़ी बोलने वालों का लगभग 44 घंटे का स्पीच डेटा शामिल है. आप OpenAI के Whisper tiny मॉडल का उपयोग करेंगे, जिसमें केवल 37M पैरामीटर्स हैं, ताकि VCTK ऑडियो डेटा को प्रीप्रोसेस कर सकें और उससे संबंधित टेक्स्ट जनरेट कर सकें.

ऑडियो प्रीप्रोसेसर (processor) लोड किया जा चुका है, और WhisperForConditionalGeneration मॉड्यूल भी उपलब्ध है. एक सैंपल ऑडियो datapoint (sample) पहले से लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Hugging Face के साथ मल्टी-मोडल मॉडल्स

पाठ्यक्रम देखें

अभ्यास निर्देश

  • openai/whisper-tiny चेकपॉइंट का उपयोग करके WhisperForConditionalGeneration प्रीट्रेन्ड मॉडल लोड करें.
  • sample datapoint को आवश्यक 16000 सैंपलिंग रेट के साथ प्रीप्रोसेस करें.
  • प्रीप्रोसेस्ड इनपुट्स के .input_features एट्रिब्यूट का उपयोग करके मॉडल से टोकन्स जनरेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None

# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)

# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)
कोड संपादित करें और चलाएँ