Začněte nyníZačněte zdarma

Imputace pomocí náhodných lesů

Přístup ke imputaci pomocí Machine Learningu může být přesnější i jednodušší na implementaci než tradiční statistické modely. Především nevyžaduje ruční specifikaci vztahů mezi proměnnými. Navíc modely jako náhodné lesy dokážou odhalovat velmi složité, nelineární závislosti a využívat je k předpovídání chybějících hodnot.

V tomto cvičení se seznámíš s balíčkem missForest, který pro každou proměnnou zvlášť sestaví samostatný náhodný les a pomocí něj predikuje chybějící hodnoty. Zavoláš imputační funkci na data o biografických filmech biopics, se kterými jsi pracoval/a dříve v kurzu, a pak z výsledku extrahuješ doplněná data i odhadované chyby imputace.

Jdeme sázet náhodné lesy!

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • Načti balíček missForest.
  • Pomocí funkce missForest() imputuj chybějící hodnoty v datech biopics; výsledek přiřaď do proměnné imp_res.
  • Extrahuj imputovaný datový soubor z imp_res, přiřaď ho do imp_data a ověř, že počet chybějících hodnot je skutečně nula.
  • Extrahuj odhadovanou chybu imputace z imp_res, přiřaď ji do imp_err a vypiš ji do konzole.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the missForest package
___

# Impute biopics data using missForest
imp_res <- ___(___)

# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))

# Extract and print imputation errors
imp_err <- imp_res$___
print(___)
Upravit a spustit kód