始める無料で始める

欠損値比率フィルターを作成する

house_sales_df データフレームには、目的変数 price と、各住宅を表し販売価格を左右するさまざまな予測子が含まれます。いくつかの特徴量には、欠損値の数に差があります。欠損値比率が高すぎる場合、その特徴量は住宅価格の予測にあまり有益ではありません。こうした特徴量は削除できます。本演習では、各列について欠損値比率を計算します。これにより、各列に適したしきい値を考える助けになります。

tidyverse パッケージはあらかじめ読み込まれています。

この演習はコースの一部です

Rによる次元削減

コースを見る

演習の手順

  • house_sales_df の総行数を n に保存します。
  • house_sales_df の各列の欠損値比率を計算し、missing_vals_df に保存します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Calculate total rows
___ <-  ___(___)

# Calculate missing value ratios
___ <- ___ %>% 
  ___(___(___(), ~ ___(___(.)))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>% 
  mutate(missing_val_ratio = ___ / ___)

# Display missing value ratios
missing_vals_df
コードを編集して実行