or
本練習屬於課程
第 1 章會帶你認識遺漏值,說明什麼是遺漏值、它們在 R 中的行為、如何偵測,以及如何計數。接著我們介紹遺漏值摘要,包含如何在個案、變數層級彙整遺漏情形,並探索資料中不同群組的差異。最後,我們討論遺漏值的視覺化:如何為整個資料集、各變數與個案製作總覽圖,及其他彙整圖,並且比較不同群組之間的差異。
在第 2 章中,你會學到如何找出像是「missing」或「N/A」這類隱藏的遺漏記號,並將它們替換為 `NA`。你也會學到如何有效處理「隱含遺漏值」——也就是沒有明確列出、但可推知為遺漏的值。此外,我們也會探討遺漏資料的相依性,說明完全隨機遺漏(MCAR)、隨機遺漏(MAR)、非隨機遺漏(MNAR),以及這些情況對你的資料分析意味著什麼。
當前練習
本章將介紹處理遺漏資料的工作流程。我們會引入特殊的資料結構:shadow matrix 與 nabular data,並示範如何在探索遺漏資料的流程中使用它們,好把遺漏情形的摘要連回到原始資料的數值。你會學到如何使用 ggplot 探索與視覺化:當其他變數出現遺漏時,數值如何變動。最後,你會學到如何視覺化兩個變數間的遺漏情況,以及為何與如何在散佈圖中呈現遺漏。
本章將介紹如何補齊資料中的遺漏值,也就是所謂的插補。你會學到如何進行插補與追蹤遺漏值,以及插補的優缺點,讓你可以將插補後的資料與原始數值進行探索、視覺化與評估。你會學到如何使用、評估與比較不同的插補模型,並探索不同插補模型如何影響你從模型中得到的推論。