शुरू करेंमुफ़्त में शुरू करें

कटऑफ पॉइंट

इस अभ्यास में, और पूरे अध्याय में, आप restaurants DataFrame के साथ काम करेंगे जिसमें अलग-अलग रेस्तरां का डेटा है। आपका अंतिम लक्ष्य एक रेस्तरां रिकमेंडेशन इंजन बनाना है, लेकिन उससे पहले आपको अपना डेटा साफ करना होगा.

restaurants का यह वर्ज़न कई स्रोतों से इकट्ठा किया गया है, जहाँ cuisine_type कॉलम में बहुत सारी टाइपो हैं, जबकि इसमें केवल italian, american और asian क्यूज़ीन टाइप होने चाहिए। यहाँ यूनिक कैटेगरी इतनी ज़्यादा हैं कि उन्हें मैन्युअल रीमैप करना स्केलेबल नहीं है, इसलिए स्ट्रिंग सिमिलैरिटी का इस्तेमाल करना बेहतर है.

ऐसा करने से पहले, आप thefuzz के process.extract() फंक्शन का उपयोग करके सिमिलैरिटी स्कोर का कटऑफ पॉइंट तय करना चाहते हैं, इसके लिए हर कैटेगरी की सबसे दूर की टाइपो (distant typo) का सिमिलैरिटी स्कोर ढूँढ़िए.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में डेटा क्लीनिंग

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import process from thefuzz
____

# Store the unique values of cuisine_type in unique_types
unique_types = ____

# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))

# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))

# Calculate similarity of 'italian' to all values of unique_types
print(____)
कोड संपादित करें और चलाएँ