Compară imputarea KNN cu imputarea prin mediană
Toți pașii de preprocesare din funcția train() se aplică pe setul de antrenament al fiecărui fold de validare încrucișată, astfel că metricile de eroare raportate includ și efectele preprocesării.
Aceasta include și metoda de imputare utilizată (de exemplu, knnImpute sau medianImpute). Este util deoarece îți permite să compari diferite metode de imputare și să o alegi pe cea care performează cel mai bine pe date nevăzute.
median_model și knn_model sunt disponibile în workspace-ul tău, la fel și resamples, care conține rezultatele re-eșantionate ale ambelor modele. Examinează rezultatele modelelor apelând
dotplot(resamples, metric = "ROC")
și alege metoda care performează cel mai bine pe date nevăzute. Care metodă de imputare produce cel mai mare scor ROC out-of-sample pentru modelul tău glm?
Acest exercițiu face parte din cursul
Machine Learning cu caret în R
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul