このコースを通して、範囲制約、データ型の制約、表記の統一など、さまざまなデータクリーニングの課題に取り組んできました。
このレッスンでは、データの健全性をチェックし、データの整合性を高める手法として、クロスフィールド検証を学びました。
これから、適用できるさまざまな概念や手法を、それぞれのカテゴリにマッピングしていきます。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、よく見られる汚れたデータの問題をどのように解決するかを学びます。データ型を変換し、将来日のデータ点を除外するために範囲制約を適用し、二重計上を避けるために重複データ点を削除します。
カテゴリ型やテキストデータは、非構造的であるためデータセットの中でも特に乱れがちな部分です。この章では、カテゴリラベルの空白や大文字・小文字の不一致を修正し、複数のカテゴリを1つにまとめ、文字列の書式をそろえて一貫性を高める方法を学びます。
この章では、ポンドではなくキログラムで重さを統一するなど、より高度なデータクリーニングの課題に取り組みます。値が正しく合計されているかを確認し、欠損値が分析に悪影響を与えないようにするための、実務で役立つスキルも身につけます。
現在の演習
レコードリンケージは、誤字や表記ゆれがある場合に複数のデータセットを結合する強力な手法です。この章では、文字列同士の類似度を計算してレコードを照合する方法を学び、最後に2つのレストランレビューのデータセットを1つのクリーンなマスターデータセットに結合します。