or
この演習はコースの一部です
この章では、最も一般的な汚れたデータの問題をどのように解決するかを学びます。データ型を変換し、将来日のデータポイントを取り除くために範囲制約を適用し、重複を削除して二重計上を防ぎます。
カテゴリデータとテキストデータは、非構造的であるためデータセットの中でも特に乱れがちです。この章では、カテゴリラベルの空白や大文字・小文字の不一致を修正し、複数のカテゴリを一つにまとめ、文字列の形式をそろえる方法を学びます。
この章では、重さをポンドではなくキログラムで統一するなど、より高度なデータクリーニングの課題に取り組みます。さらに、値が正しく集計されているかの検証や、欠損値が分析に悪影響を与えないようにするための、実務で役立つスキルも身につけます。
現在の演習
Record linkageは、タイプミスや表記ゆれがある場合に複数のデータセットを結合するための強力な手法です。この章では、文字列同士の類似度を計算してレコードをリンクする方法を学び、そのスキルを使って2つのレストランレビューのデータセットを1つのクリーンなマスターデータセットに結合します。