検索のタイプミスに合う候補を見つける
人が入力する内容には誤りがつきものです。名前や住所など、あらゆるテキストでタイプミスが起こります。データサイエンティストとしては、それに対処する方法が必要です。文字列距離を計算するのは、この問題に取り組む一つの方法です。
小さなベクトル usernames には3つの異なる名前が入っています。入力された名前 "Emile Brown" に最も近い名前を見つけてみましょう。usernames ベクトルの中から似ている名前を見つけられますか? amatch() を使ってベクトルを検索し、Google で見たことのあるようなおすすめを出力してください。
この演習はコースの一部です
Rで学ぶ中級正規表現
演習の手順
amatch()関数の最大編集距離を1に指定します。amatch()の戻り値として保存されているclosest_indexを使って、usernames内の該当する名前を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
usernames <- c("Max Power", "Emilie Brown", "Max Mustermann")
# Search usernames with a maximum edit distance of 1
closest_index <- amatch(
x = "Emile Brown",
table = usernames,
___ = ___,
method = "lv"
)
# Print the matched name in usernames at closest_index
print(glue(
"Did you mean {name_matched}?",
name_matched = ___
))