欠損値比率フィルターを作成する
house_sales_df データフレームには、目的変数 price と、各住宅を表し販売価格を左右するさまざまな予測子が含まれます。いくつかの特徴量には、欠損値の数に差があります。欠損値比率が高すぎる場合、その特徴量は住宅価格の予測にあまり有益ではありません。こうした特徴量は削除できます。本演習では、各列について欠損値比率を計算します。これにより、各列に適したしきい値を考える助けになります。
tidyverse パッケージはあらかじめ読み込まれています。
この演習はコースの一部です
Rによる次元削減
演習の手順
house_sales_dfの総行数をnに保存します。house_sales_dfの各列の欠損値比率を計算し、missing_vals_dfに保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Calculate total rows
___ <- ___(___)
# Calculate missing value ratios
___ <- ___ %>%
___(___(___(), ~ ___(___(.)))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>%
mutate(missing_val_ratio = ___ / ___)
# Display missing value ratios
missing_vals_df