รูปแบบสถาปัตยกรรมของ data pipeline
ในการสร้าง data pipeline แนวทางที่ดีคือแยกไฟล์ที่ใช้นิยามฟังก์ชันออกจากไฟล์ที่ใช้รันฟังก์ชันเหล่านั้น
ในแบบฝึกหัดนี้ จะฝึกการนำเข้าส่วนประกอบต่าง ๆ ของ pipeline เข้าสู่หน่วยความจำ ก่อนนำฟังก์ชันเหล่านั้นมารัน pipeline ตั้งแต่ต้นจนจบ โปรเจกต์มีโครงสร้างดังนี้ โดย pipeline_utils เก็บฟังก์ชัน extract(), transform(), และ load() ที่จะใช้รัน pipeline
> ls
etl_pipeline.py
pipeline_utils.py
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ETL และ ELT ด้วย Python
คำแนะนำการฝึกหัด
- นำเข้าฟังก์ชัน
extract,transform, และloadจากโมดูลpipeline_utils - ใช้ฟังก์ชันที่นำเข้ามาเพื่อรัน data pipeline ตั้งแต่ต้นจนจบ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")