เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

รูปแบบสถาปัตยกรรมของ data pipeline

ในการสร้าง data pipeline แนวทางที่ดีคือแยกไฟล์ที่ใช้นิยามฟังก์ชันออกจากไฟล์ที่ใช้รันฟังก์ชันเหล่านั้น

ในแบบฝึกหัดนี้ จะฝึกการนำเข้าส่วนประกอบต่าง ๆ ของ pipeline เข้าสู่หน่วยความจำ ก่อนนำฟังก์ชันเหล่านั้นมารัน pipeline ตั้งแต่ต้นจนจบ โปรเจกต์มีโครงสร้างดังนี้ โดย pipeline_utils เก็บฟังก์ชัน extract(), transform(), และ load() ที่จะใช้รัน pipeline

> ls
 etl_pipeline.py
 pipeline_utils.py

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ETL และ ELT ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าฟังก์ชัน extract, transform, และ load จากโมดูล pipeline_utils
  • ใช้ฟังก์ชันที่นำเข้ามาเพื่อรัน data pipeline ตั้งแต่ต้นจนจบ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
แก้ไขและรันโค้ด