เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การตรวจสอบ Data Pipeline ที่ "จุดตรวจสอบ"

ในแบบฝึกหัดนี้ คุณจะทำงานกับ data pipeline ที่ดึงข้อมูลภาษีจากไฟล์ CSV สร้างคอลัมน์ใหม่ กรองแถวตามรายได้ที่ต้องเสียภาษีเฉลี่ย และบันทึกข้อมูลลงในไฟล์ parquet

pandas ถูกโหลดไว้แล้วในชื่อ pd และฟังก์ชัน extract(), transform(), และ load() ได้รับการกำหนดไว้แล้ว คุณจะใช้ฟังก์ชันเหล่านี้เพื่อตรวจสอบ data pipeline ที่จุดตรวจสอบต่าง ๆ ระหว่างการทำงาน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ETL และ ELT ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)

# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")
แก้ไขและรันโค้ด