डेटा लोड की जाँच
मान लीजिए हर महीने आपको एक नई फ़ाइल मिलती है। आपको रिकॉर्ड्स और कॉलम्स की एक तय संख्या की उम्मीद रहती है। इस अभ्यास में हम एक फ़ंक्शन बनाएँगे जो लोड हुई फ़ाइल को वैलिडेट करेगा।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
- एक डेटा वैलिडेशन फ़ंक्शन
check_load()बनाएँ, जिसके पैरामीटर हों:df(dataframe),num_records(रिकॉर्ड्स की संख्या), औरnum_columns(कॉलम्स की संख्या). num_recordsका उपयोग करके जाँच बनाएँ कि इनपुट dataframedfमेंcount()के अनुसार उतने ही रिकॉर्ड्स हैं.- इनपुट dataframe के कॉलम्स की संख्या को
columnsपरlen()लगाकरnum_columnsसे तुलना करें. - अगर दोनों जाँचों का परिणाम
Trueहो, तोValidation Passedप्रिंट करें
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def ____(____, ____, ____):
# Takes a dataframe and compares record and column counts to input
# Message to return if the critera below aren't met
message = 'Validation Failed'
# Check number of records
if num_records == df.____():
# Check number of columns
if num_columns == ____(df.____):
# Success message
message = ____
return message
# Print the data validation message
print(check_load(df, 5000, 74))