ऑटोमैटिक स्पीच रिकग्निशन
इस अभ्यास में, आप AI की मदद से ऑडियो को अपने-आप टेक्स्ट में ट्रांसक्राइब करेंगे! आप फिर से VCTK Corpus के साथ काम करेंगे, जिसमें अलग-अलग उच्चारण वाले अंग्रेज़ी बोलने वालों का लगभग 44 घंटे का स्पीच डेटा शामिल है. आप OpenAI के Whisper tiny मॉडल का उपयोग करेंगे, जिसमें केवल 37M पैरामीटर्स हैं, ताकि VCTK ऑडियो डेटा को प्रीप्रोसेस कर सकें और उससे संबंधित टेक्स्ट जनरेट कर सकें.
ऑडियो प्रीप्रोसेसर (processor) लोड किया जा चुका है, और WhisperForConditionalGeneration मॉड्यूल भी उपलब्ध है. एक सैंपल ऑडियो datapoint (sample) पहले से लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ मल्टी-मोडल मॉडल्स
अभ्यास निर्देश
openai/whisper-tinyचेकपॉइंट का उपयोग करकेWhisperForConditionalGenerationप्रीट्रेन्ड मॉडल लोड करें.sampledatapoint को आवश्यक16000सैंपलिंग रेट के साथ प्रीप्रोसेस करें.- प्रीप्रोसेस्ड इनपुट्स के
.input_featuresएट्रिब्यूट का उपयोग करके मॉडल से टोकन्स जनरेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the pretrained model
model = ____
model.config.forced_decoder_ids=None
# Preprocess the sample audio
input_preprocessed = ____(____, sampling_rate=____, return_tensors="pt", return_attention_mask=True)
# Generate the IDs of the recognized tokens
predicted_ids = ____
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)