शुरू करेंमुफ़्त में शुरू करें

डेटा टाइप्स का सत्यापन

डेटा के इस दौर में हमारे पास पहले से कहीं अधिक एट्रिब्यूट्स की पहुँच है। इन्हें संभालने के लिए हम काफी ऑटोमेशन बनाएँगे, लेकिन न्यूनतम रूप से ज़रूरी है कि उनके डेटा टाइप्स सही हों। इस अभ्यास में आप एट्रिब्यूट्स और उनके डेटा टाइप्स की एक डिक्शनरी को वैलिडेट करेंगे कि वे सही हैं या नहीं। यह डिक्शनरी वैरिएबल validation_dict में संग्रहीत है और आपके वर्कस्पेस में उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • df का उपयोग करके dtypes से एट्रिब्यूट और डेटा टाइप वाले ट्यूपल्स की एक लिस्ट बनाएँ, जिसका नाम actual_dtypes_list रखें.
  • actual_dtypes_list पर इटरेट करें और जाँचें कि कॉलम नाम अपेक्षित dtypes की डिक्शनरी validation_dict में मौजूद हैं या नहीं.
  • जो keys डिक्शनरी में मौजूद हैं, उनके dtypes जाँचें और जो मेल खाते हों उन्हें प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)

# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
  
  # Check if column name is dictionary of expected dtypes
  col_name = attribute_tuple[____]
  if col_name in ____:

    # Compare attribute types
    col_type = attribute_tuple[____]
    if col_type == validation_dict[____]:
      print(col_name + ' has expected dtype.')
कोड संपादित करें और चलाएँ