始める無料で始める

単純代入(Simple imputation)

前の演習で見たように、欠損値のある行を削除すると、データが大きく減ってしまうことがあります。面接の文脈では、これはMachine Learningモデルの結果にバイアスを生む可能性があります。

より柔軟な対処法として、欠損値を代入(imputation)する方法があります。Pythonではさまざまなやり方がありますが、この演習では sklearn.impute モジュールの SimpleImputer()loan_data に対して使用します。

その後、pandasnumpy を使って、代入後のデータセットをDataFrameに変換します。

今回はパイプラインに2つのステップ、InstantiateFit が追加されています: Machine learning pipeline

この演習はコースの一部です

Pythonで学ぶMachine Learning面接対策

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import imputer module
from sklearn.impute import SimpleImputer

# Subset numeric features: numeric_cols
numeric_cols = ____.____(include=[____.____])
コードを編集して実行