総仕上げ
この章では、文字列の類似度を使って zagat の city 列をクリーンアップし、さらに zagat と fodors からレストランのペアを生成して比較してきました。いよいよ仕上げです。あとはペアにスコアを付けて選別し、データをリンクすれば、すぐに分析を始められます!
reclin と dplyr は読み込まれており、zagat と fodors も利用可能です。
この演習はコースの一部です
Rでのデータクリーニング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create pairs
pair_blocking(zagat, fodors, blocking_var = "city") %>%
# Compare pairs
compare_pairs(by = c("name", "addr"), default_comparator = jaro_winkler()) %>%
# Score pairs
___