處理遺漏值是資料科學中最常見的工作之一。遺漏可能有各種型態,對應的處理方法也很多樣。
你剛拿到新版的 accounts 資料框,裡面包含新舊客戶的持有金額與投資金額。不過,其中有些列的 inv_amount 是遺漏的。
accounts
inv_amount
你很確定大多數 25 歲以下的客戶還沒有投資帳戶,也懷疑這可能就是造成遺漏的原因。dplyr 與 visdat 套件已載入,accounts 也已可使用。
dplyr
visdat
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Visualize the missing values by column ___
在本章中,你會學到如何解決最常見的髒資料問題。你會轉換資料型別、套用範圍限制來移除不合理的未來時間點,並移除重複的資料點以避免重複計數。
由於非結構化的特性,類別與文字資料常是資料集中最凌亂的部分。在本章中,你會學到如何修正類別標籤中的空白與大小寫不一致、將多個類別合併為一個,以及重新格式化字串以維持一致性。
在本章中,你會深入探討更進階的資料清理問題,例如確保重量都以公斤而非磅來表示。你也會學到關鍵技巧,幫助你驗證數值是否正確填入,並避免遺漏值對分析造成不良影響。
當前練習
Record linkage 是一種強大的技術,用於在數值存在錯字或不同拼法時,將多個資料集合併。這一章中,你會學到如何透過計算字串相似度來連結紀錄,接著運用新學到的技能,把兩個餐廳評論資料集合併成一個乾淨的主資料集。