การตรวจสอบ Data Pipeline ที่ "จุดตรวจสอบ"
ในแบบฝึกหัดนี้ คุณจะทำงานกับ data pipeline ที่ดึงข้อมูลภาษีจากไฟล์ CSV สร้างคอลัมน์ใหม่ กรองแถวตามรายได้ที่ต้องเสียภาษีเฉลี่ย และบันทึกข้อมูลลงในไฟล์ parquet
pandas ถูกโหลดไว้แล้วในชื่อ pd และฟังก์ชัน extract(), transform(), และ load() ได้รับการกำหนดไว้แล้ว คุณจะใช้ฟังก์ชันเหล่านี้เพื่อตรวจสอบ data pipeline ที่จุดตรวจสอบต่าง ๆ ระหว่างการทำงาน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ETL และ ELT ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")