Imputace pomocí KNN
V předchozím cvičení jsi k doplnění chybějících hodnot v datasetu rakoviny prsu použil/a mediánovou imputaci – to ale není jediný způsob, jak s chybějícími daty pracovat.
Alternativou k mediánové imputaci je imputace pomocí k nejbližších sousedů (KNN). Jde o pokročilejší přístup, při kterém se chybějící hodnoty nahrazují hodnotami z jiných řádků, které jsou podobné aktuálnímu řádku. V praxi je implementace složitější než u jednoduché mediánové imputace, v caret ji ale snadno vyzkoušíš pomocí argumentu preProcess funkce train(). Stačí nastavit preProcess = "knnImpute" a metoda imputace použitá před trénováním modelu se změní.
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Pokyny k cvičení
V tvém pracovním prostředí jsou načteny objekty breast_cancer_x a breast_cancer_y.
- Pomocí funkce
train()natrénuj modelglms názvemknn_modelna datasetu rakoviny prsu. - K ošetření chybějících hodnot použij imputaci KNN.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Apply KNN imputation: knn_model
knn_model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print knn_model to console