欠損データを補完する
Rental Listing Inquiries データセットで、"price" 列と "building_id" 列に欠損があることが分かりました。したがって、モデルに渡す前にこれらの値を補完する必要があります。
数値特徴量の "price" は、欠損でない価格の平均値でエンコードします。
カテゴリ特徴量の "building_id" を最頻カテゴリで補完するのは良くありません。すべての "building_id" 欠損の物件が最も人気の建物にあると仮定してしまうためです。代わりに、新しいカテゴリで補完するのがよい方法です。
コンペ用データを含む DataFrame rental_listings は読み込み済みです。
この演習はコースの一部です
Pythonで挑むKaggleコンペティション
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])