จุดตัดคะแนนความคล้ายคลึง
ในแบบฝึกหัดนี้และตลอดทั้งบทนี้ คุณจะทำงานกับ DataFrame ชื่อ restaurants ซึ่งเก็บข้อมูลของร้านอาหารต่าง ๆ เป้าหมายสูงสุดคือการสร้างระบบแนะนำร้านอาหาร แต่ก่อนอื่นต้องทำความสะอาดข้อมูลก่อน
ข้อมูลใน restaurants ชุดนี้รวบรวมมาจากหลายแหล่ง โดยคอลัมน์ cuisine_type มีการสะกดผิดอยู่มาก และควรมีเฉพาะประเภทอาหาร italian, american และ asian เท่านั้น เนื่องจากมีหมวดหมู่ที่แตกต่างกันมากเกินไป การแก้ไขด้วยมือจึงไม่เหมาะสม วิธีที่ดีกว่าคือใช้ความคล้ายคลึงของสตริงแทน
ก่อนจะทำขั้นตอนนั้น ให้กำหนดจุดตัดคะแนนความคล้ายคลึงโดยใช้ฟังก์ชัน process.extract() จากไลบรารี thefuzz เพื่อหาคะแนนความคล้ายคลึงของการสะกดผิดที่ ห่างไกลที่สุด ในแต่ละหมวดหมู่
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การทำความสะอาดข้อมูลใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import process from thefuzz
____
# Store the unique values of cuisine_type in unique_types
unique_types = ____
# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))
# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))
# Calculate similarity of 'italian' to all values of unique_types
print(____)