การค้นหาข้อมูลซ้ำ
การอัปเดต data pipeline ที่ป้อนข้อมูลเข้า ride_sharing ครั้งใหม่นี้ได้เพิ่มคอลัมน์ ride_id ซึ่งเป็นตัวระบุเฉพาะของการเดินทางแต่ละครั้ง
อย่างไรก็ตาม การอัปเดตนี้เกิดขึ้นพร้อมกับความผิดปกติหลายอย่าง ได้แก่ ระยะเวลาเดินทางเฉลี่ยที่สั้นลงอย่างเห็นได้ชัด และวันเกิดของผู้ใช้ที่ถูกตั้งค่าเป็นวันในอนาคต ที่สำคัญที่สุด จำนวนการเดินทางเพิ่มขึ้น 20% ในชั่วข้ามคืน ทำให้มีเหตุให้สงสัยว่าอาจมีทั้งข้อมูลซ้ำแบบสมบูรณ์และไม่สมบูรณ์อยู่ใน DataFrame ride_sharing
ในแบบฝึกหัดนี้ จะได้ยืนยันข้อสงสัยดังกล่าวด้วยการค้นหาข้อมูลซ้ำเหล่านั้น โดยมีข้อมูลตัวอย่างของ ride_sharing พร้อมด้วยแพ็กเกจทั้งหมดที่ใช้งานมาจนถึงตอนนี้อยู่ในสภาพแวดล้อมแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การทำความสะอาดข้อมูลใน Python
คำแนะนำการฝึกหัด
- ค้นหาแถวที่ซ้ำกันของ
ride_idใน DataFrameride_sharingโดยตั้งค่าkeepเป็นFalse - Subset
ride_sharingด้วยduplicatesแล้วเรียงลำดับตามride_idจากนั้นกำหนดผลลัพธ์ให้กับduplicated_rides - แสดงคอลัมน์
ride_id,durationและuser_birth_yearของduplicated_ridesตามลำดับนี้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])