Začněte nyníZačněte zdarma

Imputace chybějících hodnot

Ve sloupci "price" a "building_id" datasetu Rental Listing Inquiries jsi našel/a chybějící hodnoty. Než data předáš modelům, je potřeba tyto hodnoty imputovat.

Numerický příznak "price" bude nahrazen průměrnou hodnotou z dostupných cen.

Imputovat kategorický příznak "building_id" nejčastější kategorií by nebylo vhodné – znamenalo by to, že všechny byty s chybějícím "building_id" se nacházejí v nejpopulárnější budově. Lepší přístup je doplnit novou kategorii.

DataFrame rental_listings s daty ze soutěže je již načtený.

Toto cvičení je součástí kurzu

Jak vyhrát soutěž na Kaggle v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
Upravit a spustit kód