Folosește imputarea KNN
În exercițiul anterior, ai folosit imputarea prin mediană pentru a completa valorile lipsă din setul de date despre cancerul mamar – însă aceasta nu este singura metodă disponibilă pentru gestionarea datelor lipsă.
O alternativă la imputarea prin mediană este imputarea prin k-cei mai apropiați vecini, sau KNN. Aceasta este o formă mai avansată de imputare, în care valorile lipsă sunt înlocuite cu valori din alte rânduri similare cu rândul curent. Deși implementarea sa practică este mult mai complexă decât simpla imputare prin mediană, explorarea ei în caret este foarte ușoară, folosind argumentul preProcess al funcției train(). Pur și simplu specifică preProcess = "knnImpute" pentru a schimba metoda de imputare aplicată înainte de antrenarea modelului.
Acest exercițiu face parte din cursul
Machine Learning cu caret în R
Instrucțiuni pentru exercițiu
breast_cancer_x și breast_cancer_y sunt încărcate în spațiul tău de lucru.
- Folosește funcția
train()pentru a antrena un modelglmnumitknn_modelpe setul de date despre cancerul mamar. - Folosește imputarea KNN pentru a gestiona valorile lipsă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Apply KNN imputation: knn_model
knn_model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print knn_model to console