你有一個 loans DataFrame,包含消費者的貸款與信用評分資料,以及像是名字與姓氏等中介資料。你想用 .duplicated() 找出完整與不完整的重複。
loans
.duplicated()
請在下方選出 .duplicated() 的「正確」用法:
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你會學到如何解決一些最常見的骯髒資料問題。你會轉換資料型別、套用範圍限制以移除未來時間點的資料,並移除重複的資料點以避免重複計算。
當前練習
由於非結構化特性,類別與文字資料常是資料集裡最雜亂的部分。在本章中,你會學到如何修正類別標籤的空白與大小寫不一致、將多個類別合併為一個,以及重新格式化字串以維持一致性。
在本章中,你將深入處理更進階的資料清理問題,例如確保重量一律使用公斤而非磅。你也會習得寶貴技巧,幫助你驗證數值是否正確相加,並確保遺漏值不會對你的分析造成負面影響。
紀錄連結是一種強大的技術,用於合併多個資料集,特別是在數值含有錯字或不同拼法時。在本章中,你會學到如何透過計算字串相似度來連結紀錄,接著運用新技巧把兩個餐廳評論資料集合併為一個乾淨的主資料集。