Imputace pomocí náhodných lesů
Přístup ke imputaci pomocí Machine Learningu může být přesnější i jednodušší na implementaci než tradiční statistické modely. Především nevyžaduje ruční specifikaci vztahů mezi proměnnými. Navíc modely jako náhodné lesy dokážou odhalovat velmi složité, nelineární závislosti a využívat je k předpovídání chybějících hodnot.
V tomto cvičení se seznámíš s balíčkem missForest, který pro každou proměnnou zvlášť sestaví samostatný náhodný les a pomocí něj predikuje chybějící hodnoty. Zavoláš imputační funkci na data o biografických filmech biopics, se kterými jsi pracoval/a dříve v kurzu, a pak z výsledku extrahuješ doplněná data i odhadované chyby imputace.
Jdeme sázet náhodné lesy!
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- Načti balíček
missForest. - Pomocí funkce
missForest()imputuj chybějící hodnoty v datechbiopics; výsledek přiřaď do proměnnéimp_res. - Extrahuj imputovaný datový soubor z
imp_res, přiřaď ho doimp_dataa ověř, že počet chybějících hodnot je skutečně nula. - Extrahuj odhadovanou chybu imputace z
imp_res, přiřaď ji doimp_erra vypiš ji do konzole.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)