ऑडियो डेटासेट का प्रीप्रोसेस करें
आप अपनी प्रिसीजन एग्रीकल्चर एप्लिकेशन को बेहतर बना रहे हैं ताकि किसान वॉयस कमांड से अपनी मशीनरी नियंत्रित कर सकें. सिस्टम को ऐसे कमांड में कीवर्ड पहचानने चाहिए जैसे "Turn on the sprinkler irrigation system."
आप "on" जैसे कीवर्ड वाले ऑडियो क्लिप्स के साथ एक कीवर्ड स्पॉटिंग डेटासेट का उपयोग करेंगे. ऑडियो फाइलों को प्रीप्रोसेस करें ताकि वे प्री-ट्रेंड Transformer मॉडल के साथ इस्तेमाल हो सकें!
कुछ डेटा पहले से लोड है:
datasetमें ऑडियो फाइलों का एक सैंपल ट्रेनिंग डेटासेट है. इसमें पहले सेtrainस्प्लिट मौजूद है, इसलिएdatasetका उपयोग करते समय आपकोtrainबताने की ज़रूरत नहीं है.AutoFeatureExtractorकोtransformersसे इम्पोर्ट किया गया है.modelका मानfacebook/wav2vec2-baseहै.max_duration1 सेकंड के रूप में परिभाषित है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PyTorch के साथ कुशल AI मॉडल प्रशिक्षण
अभ्यास निर्देश
AutoFeatureExtractorक्लास के साथ प्री-ट्रेंडfeature_extractorलोड करें.feature_extractorसे मिलने वाली rates का उपयोग करकेsampling_rateसेट करें.max_durationका उपयोग करकेaudio_arraysकाmax_lengthसेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load a pre-trained feature extractor
feature_extractor = ____.____(model)
def preprocess_function(examples):
audio_arrays = [x["array"] for x in examples["audio"]]
inputs = feature_extractor(
audio_arrays,
# Set the sampling rate
sampling_rate=____.____,
# Set the max length
max_length=int(feature_extractor.sampling_rate * max_duration),
truncation=True)
return inputs
encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)