or
この演習はコースの一部です
この章では、よく見られる汚れたデータの問題をどのように解決するかを学びます。データ型を変換し、将来日のデータ点を除外するために範囲制約を適用し、二重計上を避けるために重複データ点を削除します。
カテゴリ型やテキストデータは、非構造的であるためデータセットの中でも特に乱れがちな部分です。この章では、カテゴリラベルの空白や大文字・小文字の不一致を修正し、複数のカテゴリを1つにまとめ、文字列の書式をそろえて一貫性を高める方法を学びます。
この章では、ポンドではなくキログラムで重さを統一するなど、より高度なデータクリーニングの課題に取り組みます。値が正しく合計されているかを確認し、欠損値が分析に悪影響を与えないようにするための、実務で役立つスキルも身につけます。
現在の演習
レコードリンケージは、誤字や表記ゆれがある場合に複数のデータセットを結合する強力な手法です。この章では、文字列同士の類似度を計算してレコードを照合する方法を学び、最後に2つのレストランレビューのデータセットを1つのクリーンなマスターデータセットに結合します。