建立遺漏值篩選器
零變異篩選器只能移除部分低資訊特徵。某些特徵也可能因為遺漏值很多而幾乎沒有資訊。在這個練習中,你要建立一個遺漏值篩選器。你將採取比較激進的作法,只要某個特徵至少有一個遺漏值就把它移除;這也代表你可能會移除具有重要資訊的特徵。
house_sales_df 已可在主控台使用,且已為你載入 tidyverse 套件。
本練習屬於課程
R 的降維
練習說明
- 使用
summarize()、across()、sum()與is.na()建立遺漏值篩選器,以移除具有一個以上(含零個或更多)遺漏值的特徵,並將結果存成na_filter。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a missing values filter
___ <- ___ %>%
___(across(everything(), ~ ___)) %>%
pivot_longer(everything(), names_to = "feature", values_to = "NA_count") %>%
___(___ > ___) %>%
pull(feature)
na_filter