Začněte nyníZačněte zdarma

Porovnání KNN a mediánové imputace

Všechny kroky předzpracování uvnitř funkce train() probíhají na trénovací části každého křížového ověřovacího foldu – výsledné chybové metriky tedy už zahrnují vliv předzpracování.

Týká se to i použité metody imputace (např. knnImpute nebo medianImpute). To je výhodné, protože ti umožňuje porovnat různé metody imputace a vybrat tu, která podává nejlepší výsledky na neviděných datech.

V pracovním prostředí máš k dispozici modely median_model a knn_model a také objekt resamples, který obsahuje výsledky resamplingů obou modelů. Výsledky modelů si prohlédni zavoláním

dotplot(resamples, metric = "ROC")

a vyber ten, který si vede nejlépe na neviděných datech. Která metoda imputace dosahuje nejvyššího skóre ROC mimo trénovací sadu pro tvůj model glm?

Toto cvičení je součástí kurzu

Machine Learning s balíčkem caret v R

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení