खराब डेटा फ़िल्टर करें
ट्रांसफ़ॉर्मेशन चरण में आप जिस दोहराए जाने वाले स्टेप की अपेक्षा कर सकते हैं, वह है कुछ अधूरा डेटा साफ़ करना. इस अभ्यास में, आप कोर्स डेटा देखेंगे, जिसका फ़ॉर्मेट इस प्रकार है:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
आप इस DataFrame का निरीक्षण करेंगे और pandas DataFrame की .isnull().sum() मेथड्स का उपयोग करके सुनिश्चित करेंगे कि कोई missing values न हों. आपको मिलेगा कि programming_language कॉलम में कुछ missing values हैं.
इसलिए, आप .fillna() मेथड का उपयोग करके missing values भरने के लिए transform_fill_programming_language() फ़ंक्शन को पूरा करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Introduction to Data Engineering
अभ्यास निर्देश
course_dataमें missing values की संख्या प्रिंट करें.programming_languageकी missing values के लिए भाषा "R" होनी चाहिए.- प्रति कॉलम missing values की संख्या फिर से प्रिंट करें, इस बार
transformedके लिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)