การกรอง DataFrame ใน pandas
เมื่อดึงข้อมูลจากระบบต้นทางแล้ว ก็ถึงเวลาแปลงข้อมูล! บ่อยครั้งที่ข้อมูลต้นทางมีรายละเอียดมากเกินกว่าที่จำเป็นสำหรับการใช้งานในขั้นถัดไป หากเป็นเช่นนั้น ควรลดจำนวนมิติของข้อมูลในขั้นตอน "transform" ของ data pipeline
ได้นำเข้า pandas ในชื่อ pd แล้ว และฟังก์ชัน extract() พร้อมใช้งานสำหรับโหลด DataFrame จาก path ที่ส่งเข้าไป
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ETL และ ELT ด้วย Python
คำแนะนำการฝึกหัด
- ใช้ฟังก์ชัน
extract()เพื่อโหลด DataFrame จาก path"sales_data.parquet" - อัปเดตฟังก์ชัน
transform()ให้คืนค่าทุกแถวและทุกคอลัมน์ที่มี"Quantity Ordered"มากกว่า 1 - กรอง DataFrame
clean_dataเพิ่มเติมเพื่อให้แสดงเฉพาะคอลัมน์"Order Date","Quantity Ordered"และ"Purchase Address" - คืนค่า DataFrame ที่กรองแล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")
def transform(raw_data):
# Only keep rows with `Quantity Ordered` greater than 1
clean_data = raw_data.____[____, :]
# Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
clean_data = ____
# Return the filtered DataFrame
return ____
transform(raw_sales_data)