データ型が違えば扱い方や挙動も異なるため、手元のデータに最も適したデータ型を見極めることが重要です。この演習では、処理や洞察の抽出がしやすくなるよう、さまざまなデータを適切なデータ型に対応づける練習を行います。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、最も一般的な汚れたデータの問題をどのように解決するかを学びます。データ型を変換し、将来日のデータポイントを取り除くために範囲制約を適用し、重複を削除して二重計上を防ぎます。
現在の演習
カテゴリデータとテキストデータは、非構造的であるためデータセットの中でも特に乱れがちです。この章では、カテゴリラベルの空白や大文字・小文字の不一致を修正し、複数のカテゴリを一つにまとめ、文字列の形式をそろえる方法を学びます。
この章では、重さをポンドではなくキログラムで統一するなど、より高度なデータクリーニングの課題に取り組みます。さらに、値が正しく集計されているかの検証や、欠損値が分析に悪影響を与えないようにするための、実務で役立つスキルも身につけます。
Record linkageは、タイプミスや表記ゆれがある場合に複数のデータセットを結合するための強力な手法です。この章では、文字列同士の類似度を計算してレコードをリンクする方法を学び、そのスキルを使って2つのレストランレビューのデータセットを1つのクリーンなマスターデータセットに結合します。