始める無料で始める

検索のタイプミスに合う候補を見つける

人が入力する内容には誤りがつきものです。名前や住所など、あらゆるテキストでタイプミスが起こります。データサイエンティストとしては、それに対処する方法が必要です。文字列距離を計算するのは、この問題に取り組む一つの方法です。

小さなベクトル usernames には3つの異なる名前が入っています。入力された名前 "Emile Brown" に最も近い名前を見つけてみましょう。usernames ベクトルの中から似ている名前を見つけられますか? amatch() を使ってベクトルを検索し、Google で見たことのあるようなおすすめを出力してください。

この演習はコースの一部です

Rで学ぶ中級正規表現

コースを見る

演習の手順

  • amatch() 関数の最大編集距離を 1 に指定します。
  • amatch() の戻り値として保存されている closest_index を使って、usernames 内の該当する名前を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

usernames <- c("Max Power", "Emilie Brown", "Max Mustermann")

# Search usernames with a maximum edit distance of 1
closest_index <- amatch(
  x = "Emile Brown",
  table = usernames,
  ___ = ___,
  method = "lv"
)

# Print the matched name in usernames at closest_index
print(glue(
  "Did you mean {name_matched}?",
  name_matched = ___
))
コードを編集して実行