"चेकपॉइंट्स" पर डेटा पाइपलाइन को वैलिडेट करना
इस अभ्यास में, आप एक डेटा पाइपलाइन के साथ काम करेंगे जो CSV फ़ाइल से टैक्स डेटा एक्सट्रैक्ट करती है, एक नया कॉलम बनाती है, औसत टैक्सेबल इनकम के आधार पर पंक्तियों को फ़िल्टर करती है, और डेटा को एक parquet फ़ाइल में पर्सिस्ट करती है.
pandas को pd नाम से लोड किया गया है, और extract(), transform(), और load() फंक्शन पहले से परिभाषित हैं. आप इन फंक्शनों का उपयोग पाइपलाइन के निष्पादन के दौरान अलग-अलग चेकपॉइंट्स पर डेटा को वैलिडेट करने के लिए करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में ETL और ELT
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")