शुरू करेंमुफ़्त में शुरू करें

खराब डेटा फ़िल्टर करें

ट्रांसफ़ॉर्मेशन चरण में आप जिस दोहराए जाने वाले स्टेप की अपेक्षा कर सकते हैं, वह है कुछ अधूरा डेटा साफ़ करना. इस अभ्यास में, आप कोर्स डेटा देखेंगे, जिसका फ़ॉर्मेट इस प्रकार है:

course_id title description programming_language
1 Some Course r

आप इस DataFrame का निरीक्षण करेंगे और pandas DataFrame की .isnull().sum() मेथड्स का उपयोग करके सुनिश्चित करेंगे कि कोई missing values न हों. आपको मिलेगा कि programming_language कॉलम में कुछ missing values हैं.

इसलिए, आप .fillna() मेथड का उपयोग करके missing values भरने के लिए transform_fill_programming_language() फ़ंक्शन को पूरा करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Introduction to Data Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • course_data में missing values की संख्या प्रिंट करें.
  • programming_language की missing values के लिए भाषा "R" होनी चाहिए.
  • प्रति कॉलम missing values की संख्या फिर से प्रिंट करें, इस बार transformed के लिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
कोड संपादित करें और चलाएँ