ダミー値を作成する
列同士の「欠損と欠損」の関係を調べたのと同様に、「欠損と非欠損」の関係を列間で確認することも重要です。これは、データの欠損が生じる要因を見つける助けになります。
上の図では、Serum Insulin の欠損値が BMI の値域全体に分布していることがわかります。つまり、両者に関係はなさそうだということです。
この演習では、次の演習で上記の散布図を作成できるように、ダミー値を生成する関数を書きます。ダミー値の生成では、乱数を列の値域にスケーリングし、スケーリング係数をかけ、さらに値をシフトする操作を行います。
numpy.random から rand() 関数はインポート済みです。
この演習はコースの一部です
Pythonで欠損データに対処する
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy