結合と同様に、レコードリンケージは同じ実体に関する異なるソースのデータを紐づける手法です。ただし結合と違い、レコードリンケージはデータ同士が完全一致する必要はなく、文字列の類似度を使って近い一致を見つけられます。これにより、ユニークIDのような、データソース間で頼れる共通の一意キーがない場合でも効果を発揮します。
この演習では、各問題を解くのに最適な方法がどれかを判断します。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、最も一般的な汚れたデータの問題をどのように解決するかを学びます。データ型を変換し、将来日のデータポイントを取り除くために範囲制約を適用し、重複を削除して二重計上を防ぎます。
カテゴリデータとテキストデータは、非構造的であるためデータセットの中でも特に乱れがちです。この章では、カテゴリラベルの空白や大文字・小文字の不一致を修正し、複数のカテゴリを一つにまとめ、文字列の形式をそろえる方法を学びます。
この章では、重さをポンドではなくキログラムで統一するなど、より高度なデータクリーニングの課題に取り組みます。さらに、値が正しく集計されているかの検証や、欠損値が分析に悪影響を与えないようにするための、実務で役立つスキルも身につけます。
Record linkageは、タイプミスや表記ゆれがある場合に複数のデータセットを結合するための強力な手法です。この章では、文字列同士の類似度を計算してレコードをリンクする方法を学び、そのスキルを使って2つのレストランレビューのデータセットを1つのクリーンなマスターデータセットに結合します。
現在の演習