डेटा टाइप्स का सत्यापन
डेटा के इस दौर में हमारे पास पहले से कहीं अधिक एट्रिब्यूट्स की पहुँच है। इन्हें संभालने के लिए हम काफी ऑटोमेशन बनाएँगे, लेकिन न्यूनतम रूप से ज़रूरी है कि उनके डेटा टाइप्स सही हों। इस अभ्यास में आप एट्रिब्यूट्स और उनके डेटा टाइप्स की एक डिक्शनरी को वैलिडेट करेंगे कि वे सही हैं या नहीं। यह डिक्शनरी वैरिएबल validation_dict में संग्रहीत है और आपके वर्कस्पेस में उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
dfका उपयोग करकेdtypesसे एट्रिब्यूट और डेटा टाइप वाले ट्यूपल्स की एक लिस्ट बनाएँ, जिसका नामactual_dtypes_listरखें.actual_dtypes_listपर इटरेट करें और जाँचें कि कॉलम नाम अपेक्षित dtypes की डिक्शनरीvalidation_dictमें मौजूद हैं या नहीं.- जो keys डिक्शनरी में मौजूद हैं, उनके dtypes जाँचें और जो मेल खाते हों उन्हें प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')