शुरू करेंमुफ़्त में शुरू करें

डेटा लोड की जाँच

मान लीजिए हर महीने आपको एक नई फ़ाइल मिलती है। आपको रिकॉर्ड्स और कॉलम्स की एक तय संख्या की उम्मीद रहती है। इस अभ्यास में हम एक फ़ंक्शन बनाएँगे जो लोड हुई फ़ाइल को वैलिडेट करेगा।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक डेटा वैलिडेशन फ़ंक्शन check_load() बनाएँ, जिसके पैरामीटर हों: df (dataframe), num_records (रिकॉर्ड्स की संख्या), और num_columns (कॉलम्स की संख्या).
  • num_records का उपयोग करके जाँच बनाएँ कि इनपुट dataframe df में count() के अनुसार उतने ही रिकॉर्ड्स हैं.
  • इनपुट dataframe के कॉलम्स की संख्या को columns पर len() लगाकर num_columns से तुलना करें.
  • अगर दोनों जाँचों का परिणाम True हो, तो Validation Passed प्रिंट करें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def ____(____, ____, ____):
  # Takes a dataframe and compares record and column counts to input
  # Message to return if the critera below aren't met
  message = 'Validation Failed'
  # Check number of records
  if num_records == df.____():
    # Check number of columns
    if num_columns == ____(df.____):
      # Success message
      message = ____
  return message

# Print the data validation message
print(check_load(df, 5000, 74))
कोड संपादित करें और चलाएँ