शुरू करेंमुफ़्त में शुरू करें

डेटा पाइपलाइन आर्किटेक्चर पैटर्न

डेटा पाइपलाइन बनाते समय, जहाँ फंक्शन परिभाषित किए जाते हैं उन फ़ाइलों को, जहाँ उन्हें चलाया जाता है, उनसे अलग रखना बेहतर होता है।

इस अभ्यास में, आप पाइपलाइन के कॉम्पोनेन्ट्स को मेमोरी में इम्पोर्ट करने का अभ्यास करेंगे और फिर इन्हीं फंक्शन का उपयोग करके पाइपलाइन को एंड-टू-एंड चलाएँगे। प्रोजेक्ट का फ़ॉर्मेट नीचे दिया है, जहाँ pipeline_utils में extract(), transform(), और load() फंक्शन स्टोर हैं, जिनका उपयोग पाइपलाइन चलाने के लिए किया जाएगा।

> ls
 etl_pipeline.py
 pipeline_utils.py

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में ETL और ELT

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pipeline_utils मॉड्यूल से extract, transform, और load फंक्शन इम्पोर्ट करें।
  • इम्पोर्ट किए गए फंक्शन का उपयोग करके डेटा पाइपलाइन को एंड-टू-एंड चलाएँ।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
कोड संपादित करें और चलाएँ