शुरू करेंमुफ़्त में शुरू करें

ऑडियो डेटासेट का प्रीप्रोसेस करें

आप अपनी प्रिसीजन एग्रीकल्चर एप्लिकेशन को बेहतर बना रहे हैं ताकि किसान वॉयस कमांड से अपनी मशीनरी नियंत्रित कर सकें. सिस्टम को ऐसे कमांड में कीवर्ड पहचानने चाहिए जैसे "Turn on the sprinkler irrigation system."

आप "on" जैसे कीवर्ड वाले ऑडियो क्लिप्स के साथ एक कीवर्ड स्पॉटिंग डेटासेट का उपयोग करेंगे. ऑडियो फाइलों को प्रीप्रोसेस करें ताकि वे प्री-ट्रेंड Transformer मॉडल के साथ इस्तेमाल हो सकें!

कुछ डेटा पहले से लोड है:

  • dataset में ऑडियो फाइलों का एक सैंपल ट्रेनिंग डेटासेट है. इसमें पहले से train स्प्लिट मौजूद है, इसलिए dataset का उपयोग करते समय आपको train बताने की ज़रूरत नहीं है.
  • AutoFeatureExtractor को transformers से इम्पोर्ट किया गया है.
  • model का मान facebook/wav2vec2-base है.
  • max_duration 1 सेकंड के रूप में परिभाषित है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PyTorch के साथ कुशल AI मॉडल प्रशिक्षण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • AutoFeatureExtractor क्लास के साथ प्री-ट्रेंड feature_extractor लोड करें.
  • feature_extractor से मिलने वाली rates का उपयोग करके sampling_rate सेट करें.
  • max_duration का उपयोग करके audio_arrays का max_length सेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load a pre-trained feature extractor
feature_extractor = ____.____(model)

def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        # Set the sampling rate
        sampling_rate=____.____, 
        # Set the max length
        max_length=int(feature_extractor.sampling_rate * max_duration), 
        truncation=True)
    return inputs

encoded_dataset = dataset.map(preprocess_function, remove_columns=["audio", "file"], batched=True)
कोड संपादित करें और चलाएँ