Imputace chybějících hodnot
Ve sloupci "price" a "building_id" datasetu Rental Listing Inquiries jsi našel/a chybějící hodnoty. Než data předáš modelům, je potřeba tyto hodnoty imputovat.
Numerický příznak "price" bude nahrazen průměrnou hodnotou z dostupných cen.
Imputovat kategorický příznak "building_id" nejčastější kategorií by nebylo vhodné – znamenalo by to, že všechny byty s chybějícím "building_id" se nacházejí v nejpopulárnější budově. Lepší přístup je doplnit novou kategorii.
DataFrame rental_listings s daty ze soutěže je již načtený.
Toto cvičení je součástí kurzu
Jak vyhrát soutěž na Kaggle v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])