Zacznij terazZacznij za darmo

Znajdowanie dopasowania dla błędnie wpisanego zapytania

Dane wprowadzane przez użytkowników są bardzo podatne na błędy. Ludzie robią literówki we wszelkiego rodzaju tekstach – nawet w swoim imieniu czy adresie. Jako badacz danych musisz znaleźć sposób, żeby sobie z tym poradzić. Obliczanie odległości między ciągami znaków to jedno z podejść do tego problemu.

W wektorze usernames znajdziesz trzy różne imiona i nazwiska. Twoim zadaniem będzie znalezienie nazwy jak najbardziej zbliżonej do wprowadzonej wartości "Emile Brown". Czy uda ci się odnaleźć podobną nazwę w wektorze usernames? Użyj funkcji amatch(), aby przeszukać wektor, a następnie wyświetl rekomendację podobną do tej, którą możesz zobaczyć w Google.

To ćwiczenie jest częścią kursu

Wyrażenia regularne w R – poziom średnio zaawansowany

Zobacz kurs

Instrukcje do ćwiczenia

  • Ustaw maksymalną odległość edycji dla funkcji amatch() na 1.
  • Użyj wartości zwróconej przez amatch() – zapisanej w zmiennej closest_index – aby wyświetlić odpowiednią nazwę z wektora usernames.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

usernames <- c("Max Power", "Emilie Brown", "Max Mustermann")

# Search usernames with a maximum edit distance of 1
closest_index <- amatch(
  x = "Emile Brown",
  table = usernames,
  ___ = ___,
  method = "lv"
)

# Print the matched name in usernames at closest_index
print(glue(
  "Did you mean {name_matched}?",
  name_matched = ___
))
Edytuj i uruchom kod