เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การค้นหาข้อมูลซ้ำ

การอัปเดต data pipeline ที่ป้อนข้อมูลเข้า ride_sharing ครั้งใหม่นี้ได้เพิ่มคอลัมน์ ride_id ซึ่งเป็นตัวระบุเฉพาะของการเดินทางแต่ละครั้ง

อย่างไรก็ตาม การอัปเดตนี้เกิดขึ้นพร้อมกับความผิดปกติหลายอย่าง ได้แก่ ระยะเวลาเดินทางเฉลี่ยที่สั้นลงอย่างเห็นได้ชัด และวันเกิดของผู้ใช้ที่ถูกตั้งค่าเป็นวันในอนาคต ที่สำคัญที่สุด จำนวนการเดินทางเพิ่มขึ้น 20% ในชั่วข้ามคืน ทำให้มีเหตุให้สงสัยว่าอาจมีทั้งข้อมูลซ้ำแบบสมบูรณ์และไม่สมบูรณ์อยู่ใน DataFrame ride_sharing

ในแบบฝึกหัดนี้ จะได้ยืนยันข้อสงสัยดังกล่าวด้วยการค้นหาข้อมูลซ้ำเหล่านั้น โดยมีข้อมูลตัวอย่างของ ride_sharing พร้อมด้วยแพ็กเกจทั้งหมดที่ใช้งานมาจนถึงตอนนี้อยู่ในสภาพแวดล้อมแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ค้นหาแถวที่ซ้ำกันของ ride_id ใน DataFrame ride_sharing โดยตั้งค่า keep เป็น False
  • Subset ride_sharing ด้วย duplicates แล้วเรียงลำดับตาม ride_id จากนั้นกำหนดผลลัพธ์ให้กับ duplicated_rides
  • แสดงคอลัมน์ ride_id, duration และ user_birth_year ของ duplicated_rides ตามลำดับนี้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Find duplicates
duplicates = ____.____(____, ____)

# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')

# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])
แก้ไขและรันโค้ด