Začněte nyníZačněte zdarma

Imputace pomocí KNN

V předchozím cvičení jsi k doplnění chybějících hodnot v datasetu rakoviny prsu použil/a mediánovou imputaci – to ale není jediný způsob, jak s chybějícími daty pracovat.

Alternativou k mediánové imputaci je imputace pomocí k nejbližších sousedů (KNN). Jde o pokročilejší přístup, při kterém se chybějící hodnoty nahrazují hodnotami z jiných řádků, které jsou podobné aktuálnímu řádku. V praxi je implementace složitější než u jednoduché mediánové imputace, v caret ji ale snadno vyzkoušíš pomocí argumentu preProcess funkce train(). Stačí nastavit preProcess = "knnImpute" a metoda imputace použitá před trénováním modelu se změní.

Toto cvičení je součástí kurzu

Machine Learning s balíčkem caret v R

Zobrazit kurz

Pokyny k cvičení

V tvém pracovním prostředí jsou načteny objekty breast_cancer_x a breast_cancer_y.

  • Pomocí funkce train() natrénuj model glm s názvem knn_model na datasetu rakoviny prsu.
  • K ošetření chybějících hodnot použij imputaci KNN.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Apply KNN imputation: knn_model
knn_model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print knn_model to console
Upravit a spustit kód