सर्च टाइपो का मिलान खोजना
मानव इनपुट में अक्सर गलतियाँ होती हैं. लोग अपने नाम या पते तक में टाइपिंग की गलती कर देते हैं, और एक डेटा वैज्ञानिक के रूप में आपको इसे संभालने का तरीका खोजना होता है. इस समस्या से निपटने का एक तरीका string distances की गणना करना है.
हमारे छोटे वेक्टर usernames में तीन अलग-अलग नाम हैं. आपका काम दिए गए इनपुट "Emile Brown" के सबसे नज़दीकी नाम को खोजना है. क्या आप वेक्टर usernames में कोई मिलता-जुलता नाम ढूँढ सकते हैं? amatch() का उपयोग करके वेक्टर में खोजें और Google पर दिखने वाली सिफारिश जैसी एक recommendation प्रिंट करें.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Intermediate Regular Expressions
अभ्यास निर्देश
amatch()फंक्शन के लिए अधिकतम edit distance को1सेट करें.amatch()के return value, जोclosest_indexमें स्टोर है, का उपयोग करकेusernamesमें वह नाम प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
usernames <- c("Max Power", "Emilie Brown", "Max Mustermann")
# Search usernames with a maximum edit distance of 1
closest_index <- amatch(
x = "Emile Brown",
table = usernames,
___ = ___,
method = "lv"
)
# Print the matched name in usernames at closest_index
print(glue(
"Did you mean {name_matched}?",
name_matched = ___
))