Kom igångKom igång gratis

Använd KNN-imputering

I föregående övning använde du medianvärdesimputering för att fylla i saknade värden i bröstcancerdatasetet, men det finns fler sätt att hantera saknade data.

Ett alternativ till medianvärdesimputering är k-nearest neighbors, eller KNN-imputering. Det är en mer avancerad form av imputering där saknade värden ersätts med värden från andra rader som liknar den aktuella raden. I praktiken är detta betydligt mer komplext att implementera än enkel medianvärdesimputering, men det är mycket enkelt att utforska i caret via argumentet preProcess i train(). Använd helt enkelt preProcess = "knnImpute" för att ändra imputeringsmetod innan modellen anpassas.

Den här övningen är en del av kursen

Maskininlärning med caret i R

Visa kurs

Övningsinstruktioner

breast_cancer_x och breast_cancer_y är laddade i din arbetsmiljö.

  • Använd funktionen train() för att anpassa en glm-modell som du kallar knn_model till bröstcancerdatasetet.
  • Använd KNN-imputering för att hantera saknade värden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Apply KNN imputation: knn_model
knn_model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print knn_model to console
Redigera och kör kod