डेटा पाइपलाइन का एंड-टू-एंड टेस्टिंग
इस अभ्यास में, आप पहले वाली ही डेटा पाइपलाइन के साथ काम करेंगे, जो टैक्स डेटा को extract, transform, और load करती है. आप इस पाइपलाइन का एंड-टू-एंड टेस्ट करना अभ्यास करेंगे ताकि यह सुनिश्चित हो कि समाधान कई बार चलाया जा सके, और parquet फ़ाइल में transformed डेटा डुप्लिकेट न हो.
pandas को pd के रूप में लोड किया गया है, और extract(), transform(), और load() फंक्शन्स पहले से परिभाषित हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में ETL और ELT
अभ्यास निर्देश
for-loop का उपयोग करके ETL पाइपलाइन को तीन बार चलाएँ.- पाइपलाइन रन की हर iteration में
clean_tax_dataका shape प्रिंट करें. "clean_tax_data.parquet"फ़ाइल में स्टोर DataFrame को पढ़करto_validateवैरिएबल में लाएँ.to_validateDataFrame का shape आउटपुट करें, और उसेclean_tax_rateके shape से तुलना करें ताकि सुनिश्चित हो कि हर पाइपलाइन रन पर डेटा डुप्लिकेट नहीं हुआ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Trigger the data pipeline to run three times
____ attempt in range(0, ____):
print(f"Attempt: {attempt}")
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
load(clean_tax_data, "clean_tax_data.parquet")
# Print the shape of the cleaned_tax_data DataFrame
print(f"Shape of clean_tax_data: {clean_tax_data.____}")
# Read in the loaded data, check the shape
to_validate = pd.____("clean_tax_data.parquet")
print(f"Final shape of cleaned data: {to_validate.____}")