अलग-अलग मेथड आज़माएँ
बहुत बढ़िया, आपने string distances निकालने के कई मेथड्स के बारे में सीख लिया है। कौन-सा मेथड इस्तेमाल करना है, यह कई बातों पर निर्भर करता है, इसलिए अलग-अलग मेथड्स और उनके पैरामीटर्स के साथ थोड़ा प्रयोग करना अच्छा रहता है ताकि आप उन्हें बेहतर समझ सकें। इस अभ्यास में आप "Marya Carey" सर्च टर्म का इस्तेमाल करेंगे — यह नाम "Mariah Carey" की गलत टाइप की गई वर्ज़न है। अलग-अलग string distance मेथड्स के साथ गलत टाइप किया गया नाम असली नाम से कितना मिलता-जुलता है?
उद्देश्य यह है कि ऐसे पैरामीटर्स चुनें जो ऊपर बताए गए दोनों नामों के लिए distance कम दें, जबकि सूची में मौजूद दूसरे नामों (जो लक्षित व्यक्ति नहीं हैं) से distance बड़ा बना रहे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Intermediate Regular Expressions
अभ्यास निर्देश
- substring length मान
1और2के लिए q-grams जनरेट करें. - q-gram मेथड का उपयोग करके
searchऔरnamesके बीच substring length मान1और2के लिए string distance निकालें. "osa"मेथड का उपयोग करकेsearchऔरnamesके बीच string distance निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
search <- "Mariah Carey"
names <- c("M. Carey", "Mick Jagger", "Michael Jackson")
# Pass the values 1 and 2 as "q" and inspect the qgrams
qgrams("Mariah Carey", "M. Carey", q = ___)
qgrams("Mariah Carey", "M. Carey", q = ___)
# Try the qgram method on the variables search and names
stringdist(___, ___, method = "___", q = 1)
stringdist(___, ___, method = "___", q = 2)
# Try the default method (osa) on the same input and compare
stringdist(___, ___, method = "___")