เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

จุดตัดคะแนนความคล้ายคลึง

ในแบบฝึกหัดนี้และตลอดทั้งบทนี้ คุณจะทำงานกับ DataFrame ชื่อ restaurants ซึ่งเก็บข้อมูลของร้านอาหารต่าง ๆ เป้าหมายสูงสุดคือการสร้างระบบแนะนำร้านอาหาร แต่ก่อนอื่นต้องทำความสะอาดข้อมูลก่อน

ข้อมูลใน restaurants ชุดนี้รวบรวมมาจากหลายแหล่ง โดยคอลัมน์ cuisine_type มีการสะกดผิดอยู่มาก และควรมีเฉพาะประเภทอาหาร italian, american และ asian เท่านั้น เนื่องจากมีหมวดหมู่ที่แตกต่างกันมากเกินไป การแก้ไขด้วยมือจึงไม่เหมาะสม วิธีที่ดีกว่าคือใช้ความคล้ายคลึงของสตริงแทน

ก่อนจะทำขั้นตอนนั้น ให้กำหนดจุดตัดคะแนนความคล้ายคลึงโดยใช้ฟังก์ชัน process.extract() จากไลบรารี thefuzz เพื่อหาคะแนนความคล้ายคลึงของการสะกดผิดที่ ห่างไกลที่สุด ในแต่ละหมวดหมู่

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import process from thefuzz
____

# Store the unique values of cuisine_type in unique_types
unique_types = ____

# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))

# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))

# Calculate similarity of 'italian' to all values of unique_types
print(____)
แก้ไขและรันโค้ด