不一致の修正
dest_size に空白の不一致があり、cleanliness に大文字・小文字の不一致があることを特定しました。ここでは、新しく学んだツールを使って、sfo_survey 内の不一致な値を修正します。データ点を丸ごと削除してしまうと、5%以上を削除する必要がある場合にデータセットへ偏りを生む可能性があるためです。
dplyr と stringr は読み込まれており、sfo_survey が利用可能です。
この演習はコースの一部です
Rでのデータクリーニング
演習の手順
sfo_surveyにdest_size_trimmedという列を追加し、dest_size列の値から先頭・末尾の空白をすべて取り除いた値を入れてください。- さらに
cleanliness_lowerという列を追加し、cleanliness列の値をすべて小文字に変換したものを入れてください。 dest_size_trimmedの各カテゴリの出現回数を数えてください。cleanliness_lowerの各カテゴリの出現回数を数えてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___