始める無料で始める

欠損データの補完

欠損データは避けられません。データが完全にランダムに欠損していると仮定する場合、手元のデータが母集団をよく代表しているとみなします。欠損が少しであれば、削除することも、平均値や中央値で置き換えることもできます。この演習では、現行価格での市場掲載日数である 'PDOM' を扱います。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • where()isNull()count() を使って、列 'PDOM' の欠損値の件数を数えます。
  • 集約関数 mean() を使って 'PDOM' の平均値を計算します。
  • fillna() を、値を 'PDOM' の平均値に設定し、subset パラメータで列 'PDOM' のみに適用します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
コードを編集して実行