ÎncepețiÎncepe gratuit

Folosește imputarea KNN

În exercițiul anterior, ai folosit imputarea prin mediană pentru a completa valorile lipsă din setul de date despre cancerul mamar – însă aceasta nu este singura metodă disponibilă pentru gestionarea datelor lipsă.

O alternativă la imputarea prin mediană este imputarea prin k-cei mai apropiați vecini, sau KNN. Aceasta este o formă mai avansată de imputare, în care valorile lipsă sunt înlocuite cu valori din alte rânduri similare cu rândul curent. Deși implementarea sa practică este mult mai complexă decât simpla imputare prin mediană, explorarea ei în caret este foarte ușoară, folosind argumentul preProcess al funcției train(). Pur și simplu specifică preProcess = "knnImpute" pentru a schimba metoda de imputare aplicată înainte de antrenarea modelului.

Acest exercițiu face parte din cursul

Machine Learning cu caret în R

Vezi cursul

Instrucțiuni pentru exercițiu

breast_cancer_x și breast_cancer_y sunt încărcate în spațiul tău de lucru.

  • Folosește funcția train() pentru a antrena un model glm numit knn_model pe setul de date despre cancerul mamar.
  • Folosește imputarea KNN pentru a gestiona valorile lipsă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Apply KNN imputation: knn_model
knn_model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print knn_model to console
Editează și rulează codul