Record linkage 與 join 類似,都是把來自不同來源、關於同一個實體的資料連結起來。不過與 join 不同的是,record linkage 不需要不同資料之間完全相同的鍵值;它可以透過字串相似度找出近似的配對。因此,當不同資料來源之間沒有可依賴的共同唯一鍵(例如唯一識別碼)時,record linkage 就特別有效。
在這個練習中,你要判斷每個問題最適合用哪一種方法來解決。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你會學到如何解決最常見的髒資料問題。你會轉換資料型別、套用範圍限制來移除不合理的未來時間點,並移除重複的資料點以避免重複計數。
由於非結構化的特性,類別與文字資料常是資料集中最凌亂的部分。在本章中,你會學到如何修正類別標籤中的空白與大小寫不一致、將多個類別合併為一個,以及重新格式化字串以維持一致性。
在本章中,你會深入探討更進階的資料清理問題,例如確保重量都以公斤而非磅來表示。你也會學到關鍵技巧,幫助你驗證數值是否正確填入,並避免遺漏值對分析造成不良影響。
Record linkage 是一種強大的技術,用於在數值存在錯字或不同拼法時,將多個資料集合併。這一章中,你會學到如何透過計算字串相似度來連結紀錄,接著運用新學到的技能,把兩個餐廳評論資料集合併成一個乾淨的主資料集。
當前練習