依比例合併類別
很多時候,你不一定有特定的層級要改名或彼此合併。更常見的是,你想保留最常見的幾個層級,然後把其餘全部放進「other」。當層級很多、而且多數都很少見時,這樣做特別有助於呈現資料。我們用 Kaggle 問卷中關於「明年想嘗試哪些機器學習方法」的題目來試試看。系統已為你載入 multiple_choice_responses。在計數時,請記得 sort = TRUE 預設代表由大到小的降冪排序。
本練習屬於課程
Tidyverse 的類別資料
練習說明
- 移除沒有選任何方法的人。
- 從
MLMethodNextYearSelect建立新變數ml_method,保留至少有 5% 受訪者選到的標題,其他則合併為「Other」(預設值)。 - 最後,對新變數做計數,並以降冪排序。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
multiple_choice_responses %>%
# Remove NAs of MLMethodNextYearSelect
filter(___) %>%
# Create ml_method, which lumps all those with less than 5% of people into "Other"
mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
# Count the frequency of your new variable, sorted in descending order
___(___, ___)