Använd KNN-imputering
I föregående övning använde du medianvärdesimputering för att fylla i saknade värden i bröstcancerdatasetet, men det finns fler sätt att hantera saknade data.
Ett alternativ till medianvärdesimputering är k-nearest neighbors, eller KNN-imputering. Det är en mer avancerad form av imputering där saknade värden ersätts med värden från andra rader som liknar den aktuella raden. I praktiken är detta betydligt mer komplext att implementera än enkel medianvärdesimputering, men det är mycket enkelt att utforska i caret via argumentet preProcess i train(). Använd helt enkelt preProcess = "knnImpute" för att ändra imputeringsmetod innan modellen anpassas.
Den här övningen är en del av kursen
Maskininlärning med caret i R
Övningsinstruktioner
breast_cancer_x och breast_cancer_y är laddade i din arbetsmiljö.
- Använd funktionen
train()för att anpassa englm-modell som du kallarknn_modeltill bröstcancerdatasetet. - Använd KNN-imputering för att hantera saknade värden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Apply KNN imputation: knn_model
knn_model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print knn_model to console