शुरू करेंमुफ़्त में शुरू करें

डेटा पाइपलाइन का एंड-टू-एंड टेस्टिंग

इस अभ्यास में, आप पहले वाली ही डेटा पाइपलाइन के साथ काम करेंगे, जो टैक्स डेटा को extract, transform, और load करती है. आप इस पाइपलाइन का एंड-टू-एंड टेस्ट करना अभ्यास करेंगे ताकि यह सुनिश्चित हो कि समाधान कई बार चलाया जा सके, और parquet फ़ाइल में transformed डेटा डुप्लिकेट न हो.

pandas को pd के रूप में लोड किया गया है, और extract(), transform(), और load() फंक्शन्स पहले से परिभाषित हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में ETL और ELT

पाठ्यक्रम देखें

अभ्यास निर्देश

  • for-loop का उपयोग करके ETL पाइपलाइन को तीन बार चलाएँ.
  • पाइपलाइन रन की हर iteration में clean_tax_data का shape प्रिंट करें.
  • "clean_tax_data.parquet" फ़ाइल में स्टोर DataFrame को पढ़कर to_validate वैरिएबल में लाएँ.
  • to_validate DataFrame का shape आउटपुट करें, और उसे clean_tax_rate के shape से तुलना करें ताकि सुनिश्चित हो कि हर पाइपलाइन रन पर डेटा डुप्लिकेट नहीं हुआ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
	print(f"Attempt: {attempt}")
	raw_tax_data = extract("raw_tax_data.csv")
	clean_tax_data = transform(raw_tax_data)
	load(clean_tax_data, "clean_tax_data.parquet")
	
	# Print the shape of the cleaned_tax_data DataFrame
	print(f"Shape of clean_tax_data: {clean_tax_data.____}")
    
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")
कोड संपादित करें और चलाएँ