始める無料で始める

欠損データを補完する

Rental Listing Inquiries データセットで、"price" 列と "building_id" 列に欠損があることが分かりました。したがって、モデルに渡す前にこれらの値を補完する必要があります。

数値特徴量の "price" は、欠損でない価格の平均値でエンコードします。

カテゴリ特徴量の "building_id" を最頻カテゴリで補完するのは良くありません。すべての "building_id" 欠損の物件が最も人気の建物にあると仮定してしまうためです。代わりに、新しいカテゴリで補完するのがよい方法です。

コンペ用データを含む DataFrame rental_listings は読み込み済みです。

この演習はコースの一部です

Pythonで挑むKaggleコンペティション

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
コードを編集して実行