欠損データの補完
欠損データは避けられません。データが完全にランダムに欠損していると仮定する場合、手元のデータが母集団をよく代表しているとみなします。欠損が少しであれば、削除することも、平均値や中央値で置き換えることもできます。この演習では、現行価格での市場掲載日数である 'PDOM' を扱います。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
where()、isNull()、count()を使って、列'PDOM'の欠損値の件数を数えます。- 集約関数
mean()を使って'PDOM'の平均値を計算します。 fillna()を、値を'PDOM'の平均値に設定し、subsetパラメータで列'PDOM'のみに適用します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])