開始使用免費開始

建立遺漏值比例篩選器

house_sales_df 資料框包含目標變數 price,以及描述各間房屋並影響其售價的多種預測變數。部分特徵有不同數量的遺漏值。若遺漏值比例過高,該特徵對於預測房價的資訊量就不大,可以移除。在本練習中,你會為每個欄位計算遺漏值比例,這有助於你思考各欄位合適的門檻值。

已為你載入 tidyverse 套件。

本練習屬於課程

R 的降維

檢視課程

練習說明

  • house_sales_df 的總列數儲存到 n
  • 計算 house_sales_df 各欄位的遺漏值比例,並將結果儲存在 missing_vals_df

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Calculate total rows
___ <-  ___(___)

# Calculate missing value ratios
___ <- ___ %>% 
  ___(___(___(), ~ ___(___(.)))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "num_missing_values") %>% 
  mutate(missing_val_ratio = ___ / ___)

# Display missing value ratios
missing_vals_df
編輯並執行程式碼