or
本練習屬於課程
在本章中,你會了解為何遺漏資料會對資料集分析帶來風險。你將認識三種遺漏機制,並學會如何用統計檢定與視覺化工具來辨識它們。
認識插補方法的分類,並學習三種以捐贈者為基礎的技術:平均插補、hot-deck,以及 k-Nearest-Neighbors 插補。你會一探其原理,了解這些方法如何運作,接著把它們應用到真實的熱帶天氣資料集。同時,你也會學到一些實用技巧,讓這些方法更貼近你的問題情境並有更佳表現。
現在要學習如何運用統計與機器學習模型(例如線性迴歸、羅吉斯迴歸與隨機森林)來插補遺漏資料。本章會帶你了解這些模型如何做出預測,並運用這些知識,從條件分配中抽取插補值。這很重要,因為可以讓插補值更具變異且更合理,更接近真實資料。
插補後的數值不是板上釘釘。它們只是估計值,而估計都伴隨不確定性。在最後一章,你會學到如何使用自助法(bootstrapping)與使用 mice 套件的連鎖方程(chained equations),把插補不確定性納入模型與分析中,使其更可靠、更穩健。
當前練習