เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การกรอง DataFrame ใน pandas

เมื่อดึงข้อมูลจากระบบต้นทางแล้ว ก็ถึงเวลาแปลงข้อมูล! บ่อยครั้งที่ข้อมูลต้นทางมีรายละเอียดมากเกินกว่าที่จำเป็นสำหรับการใช้งานในขั้นถัดไป หากเป็นเช่นนั้น ควรลดจำนวนมิติของข้อมูลในขั้นตอน "transform" ของ data pipeline

ได้นำเข้า pandas ในชื่อ pd แล้ว และฟังก์ชัน extract() พร้อมใช้งานสำหรับโหลด DataFrame จาก path ที่ส่งเข้าไป

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ETL และ ELT ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ฟังก์ชัน extract() เพื่อโหลด DataFrame จาก path "sales_data.parquet"
  • อัปเดตฟังก์ชัน transform() ให้คืนค่าทุกแถวและทุกคอลัมน์ที่มี "Quantity Ordered" มากกว่า 1
  • กรอง DataFrame clean_data เพิ่มเติมเพื่อให้แสดงเฉพาะคอลัมน์ "Order Date", "Quantity Ordered" และ "Purchase Address"
  • คืนค่า DataFrame ที่กรองแล้ว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Extract data from the sales_data.parquet path
raw_sales_data = ____("sales_data.parquet")

def transform(raw_data):
  	# Only keep rows with `Quantity Ordered` greater than 1
    clean_data = raw_data.____[____, :]
    
    # Only keep columns "Order Date", "Quantity Ordered", and "Purchase Address"
    clean_data = ____
    
    # Return the filtered DataFrame
    return ____
    
transform(raw_sales_data)
แก้ไขและรันโค้ด