在影片練習中,你學到分類資料中可能出現的各種不一致,這會讓某個變數看起來好像有比實際更多的類別。
在這個練習中,你會繼續使用 sfo_survey 資料集。你會再次檢視 dest_size 欄位以及 cleanliness 欄位,並判斷這兩個類別變數各自面臨哪些問題(如果有的話)。
sfo_survey
dest_size
cleanliness
已載入 dplyr,且 sfo_survey 可供使用。
dplyr
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Count dest_size sfo_survey %>% ___
在本章中,你會學到如何解決最常見的髒資料問題。你會轉換資料型別、套用範圍限制來移除不合理的未來時間點,並移除重複的資料點以避免重複計數。
由於非結構化的特性,類別與文字資料常是資料集中最凌亂的部分。在本章中,你會學到如何修正類別標籤中的空白與大小寫不一致、將多個類別合併為一個,以及重新格式化字串以維持一致性。
當前練習
在本章中,你會深入探討更進階的資料清理問題,例如確保重量都以公斤而非磅來表示。你也會學到關鍵技巧,幫助你驗證數值是否正確填入,並避免遺漏值對分析造成不良影響。
Record linkage 是一種強大的技術,用於在數值存在錯字或不同拼法時,將多個資料集合併。這一章中,你會學到如何透過計算字串相似度來連結紀錄,接著運用新學到的技能,把兩個餐廳評論資料集合併成一個乾淨的主資料集。