ऑडियो प्री-प्रोसेसिंग
इस अभ्यास में, आप ऑडियो डेटा का सैंपलिंग रेट कैसे बदलते हैं और एक ऑटोमैटिक प्रीप्रोसेसर का उपयोग कैसे करते हैं, यह सीखेंगे. आप VCTK Corpus के साथ काम करेंगे, जिसमें लगभग 44 घंटे का स्पीच डेटा है, जो 110 अंग्रेज़ी बोलने वालों द्वारा अलग-अलग उच्चारणों में बोला गया है.
dataset पहले से लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Hugging Face के साथ मल्टी-मोडल मॉडल्स
अभ्यास निर्देश
.cast_column()मेथड का उपयोग करके डेटासेट में ऑडियो को 16,000 Hz की फ्रीक्वेंसी पर रीसैंपल करें.- प्रीट्रेन्ड
openai/whisper-smallमॉडल का उपयोग करके ऑडियो प्रोसेसर लोड करें. - पहले डेटा पॉइंट के ऑडियो को प्रीप्रोसेस करें, वही सैंपलिंग रेट निर्दिष्ट करते हुए और
padding=Trueसेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Resample the audio to a frequency of 16,000 Hz
dataset = dataset.____("____", ____(sampling_rate=____))
# Load the audio processor
processor = ____
# Preprocess the audio data of the 0th dataset element
audio_pp = ____(dataset[0]["audio"]["array"], sampling_rate=____, padding=True, return_tensors="pt")
make_spectrogram(audio_pp["input_features"][0])