你正在前處理美國陸軍身體測量資料集 ANSUR II(ANSUR II),以便在單一 pipeline 中訓練多個模型。你會嘗試使用 nest() 函式,建立一個包含巢狀 tibble(各子資料集)的清單欄位。
nest()
dplyr 套件已為你預先載入。
dplyr
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
ansur_df %>% # Group the data by branch, then nest ___ %>% ___
本章將介紹本課程的核心概念:整齊資料。前兩節課你會直接上手,將凌亂的字串欄拆解成整齊的變數與觀測值,為分析做好準備。最後一節課,你會學習如何覆寫並移除遺漏值。
本章重點是利用 `pivot_longer()` 與 `pivot_wider()` 在寬表與長表之間來回轉換。當變數被藏在混亂的欄名裡,或是被放在列而非欄時,你就需要這些函式。過程中你會認識太空犬、核彈,以及行星溫度等案例。
你的資料中經常會有遺漏值,有時甚至整筆觀測都缺少。本章會教你如何用這些缺少的觀測來補全資料集。你將為計數資料加入值為 0 的觀測、把時間序列擴展為完整的區間序列,還有更多實用技巧!
在最後一章,你會學到如何把 JSON、XML 等巢狀資料結構轉換為整齊、矩形化的資料。這項能力能讓你處理來自網路 API 的資料。你也會學到如何運用巢狀資料結構,撰寫優雅的建模流程管線,並產生整齊的輸出。
當前練習