शुरू करेंमुफ़्त में शुरू करें

DAG परिभाषित करना

पिछले अभ्यासों में, आपने extract, transform और load चरणों को अलग-अलग पूरा किया था। अब यह सब एक सुसंगत etl() फंक्शन में जोड़ा गया है, जिसे आप कंसोल में देख सकते हैं.

etl() फंक्शन संबंधित डेटाबेस से कच्चे course और ratings डेटा को एक्स्ट्रैक्ट करता है, करप्ट डेटा को साफ करता है और missing values भरता है, प्रत्येक कोर्स की औसत रेटिंग निकालता है और सिफारिशें बनाने के लिए तय किए गए decision rules के आधार पर रिकमेंडेशंस तैयार करता है, और अंत में उन रिकमेंडेशंस को एक डेटाबेस में लोड करता है.

वीडियो से आपको याद होगा कि etl() एक ही आर्ग्युमेंट लेता है: db_engines. आप इसे PythonOperator में op_kwargs का उपयोग करके टास्क को पास कर सकते हैं। आप इसे एक डिक्शनरी पास कर सकते हैं, जिसे callable में kwargs के रूप में भरा जाएगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Introduction to Data Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • DAG की परिभाषा पूरी करें ताकि यह रोज़ाना चले। ध्यान रखें कि cron लिखावट का उपयोग करें।
  • PythonOperator() को सही आर्ग्युमेंट्स पास करके पूरा करें। etl के अलावा, db_engines भी आपके वर्कस्पेस में उपलब्ध है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Define the DAG so it runs on a daily basis
dag = DAG(dag_id="recommendations",
          schedule_interval="____")

# Make sure `etl()` is called in the operator. Pass the correct kwargs.
task_recommendations = PythonOperator(
    task_id="recommendations_task",
    python_callable=____,
    op_kwargs={"____": ____},
)
कोड संपादित करें और चलाएँ