Znajdowanie dopasowania dla błędnie wpisanego zapytania
Dane wprowadzane przez użytkowników są bardzo podatne na błędy. Ludzie robią literówki we wszelkiego rodzaju tekstach – nawet w swoim imieniu czy adresie. Jako badacz danych musisz znaleźć sposób, żeby sobie z tym poradzić. Obliczanie odległości między ciągami znaków to jedno z podejść do tego problemu.
W wektorze usernames znajdziesz trzy różne imiona i nazwiska. Twoim zadaniem będzie znalezienie nazwy jak najbardziej zbliżonej do wprowadzonej wartości "Emile Brown". Czy uda ci się odnaleźć podobną nazwę w wektorze usernames? Użyj funkcji amatch(), aby przeszukać wektor, a następnie wyświetl rekomendację podobną do tej, którą możesz zobaczyć w Google.
To ćwiczenie jest częścią kursu
Wyrażenia regularne w R – poziom średnio zaawansowany
Instrukcje do ćwiczenia
- Ustaw maksymalną odległość edycji dla funkcji
amatch()na1. - Użyj wartości zwróconej przez
amatch()– zapisanej w zmiennejclosest_index– aby wyświetlić odpowiednią nazwę z wektorausernames.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
usernames <- c("Max Power", "Emilie Brown", "Max Mustermann")
# Search usernames with a maximum edit distance of 1
closest_index <- amatch(
x = "Emile Brown",
table = usernames,
___ = ___,
method = "lv"
)
# Print the matched name in usernames at closest_index
print(glue(
"Did you mean {name_matched}?",
name_matched = ___
))