你想了解剛建立的模型對資料的擬合程度。為了量化這點,你想計算真實與預測收入之間的絕對誤差的中位數。你執行了以下程式碼:
median(abs(biopics$earnings - model_1$fitted.values), na.rm = TRUE)
你覺得結果會是什麼?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你會了解為何遺漏資料會對資料集分析帶來風險。你將認識三種遺漏機制,並學會如何用統計檢定與視覺化工具來辨識它們。
當前練習
認識插補方法的分類,並學習三種以捐贈者為基礎的技術:平均插補、hot-deck,以及 k-Nearest-Neighbors 插補。你會一探其原理,了解這些方法如何運作,接著把它們應用到真實的熱帶天氣資料集。同時,你也會學到一些實用技巧,讓這些方法更貼近你的問題情境並有更佳表現。
現在要學習如何運用統計與機器學習模型(例如線性迴歸、羅吉斯迴歸與隨機森林)來插補遺漏資料。本章會帶你了解這些模型如何做出預測,並運用這些知識,從條件分配中抽取插補值。這很重要,因為可以讓插補值更具變異且更合理,更接近真實資料。
插補後的數值不是板上釘釘。它們只是估計值,而估計都伴隨不確定性。在最後一章,你會學到如何使用自助法(bootstrapping)與使用 mice 套件的連鎖方程(chained equations),把插補不確定性納入模型與分析中,使其更可靠、更穩健。