Jämför KNN- och medianimputation
Alla förbehandlingssteg i funktionen train() utförs på träningsdelen av varje korsvalideringsveck, så de felmått som rapporteras inkluderar effekterna av förbehandlingen.
Detta gäller även den imputeringsmetod som används (t.ex. knnImpute eller medianImpute). Det är användbart eftersom du kan jämföra olika imputeringsmetoder och välja den som presterar bäst på data som modellen inte tränat på.
median_model och knn_model finns tillgängliga i din arbetsmiljö, liksom resamples, som innehåller de omsamplade resultaten för båda modellerna. Undersök modellresultaten genom att anropa
dotplot(resamples, metric = "ROC")
och välj den metod som presterar bäst på osedd data. Vilken imputeringsmetod ger det högsta out-of-sample ROC-värdet för din glm-modell?
Den här övningen är en del av kursen
Maskininlärning med caret i R
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen