Imputera saknade värden
Du har upptäckt att kolumnerna "price" och "building_id" innehåller saknade värden i datamängden Rental Listing Inquiries. Innan du skickar data till modellerna behöver du imputera dessa värden.
Det numeriska särdragets "price" kodas med ett medelvärde av de priser som inte saknas.
Att imputera det kategoriska särdragets "building_id" med den vanligaste kategorin är en dålig idé, eftersom det skulle innebära att alla lägenheter med ett saknat "building_id" finns i det mest populära byggnaden. Ett bättre alternativ är att imputera med en ny kategori.
DataFrame:en rental_listings med tävlingsdata är redan inläst åt dig.
Den här övningen är en del av kursen
Vinna en Kaggle-tävling i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])