Uzupełnianie brakujących danych
Okazuje się, że kolumny "price" i "building_id" mają brakujące wartości w zbiorze danych Rental Listing Inquiries. Przed przekazaniem danych do modeli trzeba te wartości uzupełnić.
Numeryczna cecha "price" zostanie zakodowana średnią wartością spośród dostępnych cen.
Uzupełnianie kategorycznej cechy "building_id" najczęściej występującą kategorią to zły pomysł – oznaczałoby to, że wszystkie mieszkania z brakującym "building_id" znajdują się w najpopularniejszym budynku. Lepszym rozwiązaniem jest przypisanie im nowej kategorii.
DataFrame rental_listings z danymi konkursowymi jest już wczytany.
To ćwiczenie jest częścią kursu
Zwycięstwo w konkursie Kaggle w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])