建立遺漏值比例篩選器
house_sales_df 資料框包含目標變數 price,以及描述各間房屋並影響其售價的多種預測變數。部分特徵有不同數量的遺漏值。若遺漏值比例過高,該特徵對於預測房價的資訊量就不大,可以移除。在本練習中,你會為每個欄位計算遺漏值比例,這有助於你思考各欄位合適的門檻值。
已為你載入 tidyverse 套件。
本練習屬於課程
R 的降維
練習說明
- 將
house_sales_df的總列數儲存到n。 - 計算
house_sales_df各欄位的遺漏值比例,並將結果儲存在missing_vals_df。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Calculate total rows
___ <- ___(___)
# Calculate missing value ratios
___ <- ___ %>%
___(___(___(), ~ ___(___(.)))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>%
mutate(missing_val_ratio = ___ / ___)
# Display missing value ratios
missing_vals_df