Porovnání KNN a mediánové imputace
Všechny kroky předzpracování uvnitř funkce train() probíhají na trénovací části každého křížového ověřovacího foldu – výsledné chybové metriky tedy už zahrnují vliv předzpracování.
Týká se to i použité metody imputace (např. knnImpute nebo medianImpute). To je výhodné, protože ti umožňuje porovnat různé metody imputace a vybrat tu, která podává nejlepší výsledky na neviděných datech.
V pracovním prostředí máš k dispozici modely median_model a knn_model a také objekt resamples, který obsahuje výsledky resamplingů obou modelů. Výsledky modelů si prohlédni zavoláním
dotplot(resamples, metric = "ROC")
a vyber ten, který si vede nejlépe na neviděných datech. Která metoda imputace dosahuje nejvyššího skóre ROC mimo trénovací sadu pro tvůj model glm?
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení