Kom igångKom igång gratis

Imputera saknade värden

Du har upptäckt att kolumnerna "price" och "building_id" innehåller saknade värden i datamängden Rental Listing Inquiries. Innan du skickar data till modellerna behöver du imputera dessa värden.

Det numeriska särdragets "price" kodas med ett medelvärde av de priser som inte saknas.

Att imputera det kategoriska särdragets "building_id" med den vanligaste kategorin är en dålig idé, eftersom det skulle innebära att alla lägenheter med ett saknat "building_id" finns i det mest populära byggnaden. Ett bättre alternativ är att imputera med en ny kategori.

DataFrame:en rental_listings med tävlingsdata är redan inläst åt dig.

Den här övningen är en del av kursen

Vinna en Kaggle-tävling i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
Redigera och kör kod