Zacznij terazZacznij za darmo

Uzupełnianie brakujących danych

Okazuje się, że kolumny "price" i "building_id" mają brakujące wartości w zbiorze danych Rental Listing Inquiries. Przed przekazaniem danych do modeli trzeba te wartości uzupełnić.

Numeryczna cecha "price" zostanie zakodowana średnią wartością spośród dostępnych cen.

Uzupełnianie kategorycznej cechy "building_id" najczęściej występującą kategorią to zły pomysł – oznaczałoby to, że wszystkie mieszkania z brakującym "building_id" znajdują się w najpopularniejszym budynku. Lepszym rozwiązaniem jest przypisanie im nowej kategorii.

DataFrame rental_listings z danymi konkursowymi jest już wczytany.

To ćwiczenie jest częścią kursu

Zwycięstwo w konkursie Kaggle w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
Edytuj i uruchom kod