Zabalení imputace a modelování do funkce
Kdykoli provádíš analýzu nebo modelování na imputovaných datech, měl/a bys zohlednit nejistotu plynoucí z imputace. Spuštění modelu na datech imputovaných pouze jednou pomíjí skutečnost, že imputace odhaduje chybějící hodnoty s určitou mírou nejistoty. Standardní chyby takového modelu bývají příliš malé. Řešením je vícenásobná imputace – jedním ze způsobů, jak ji implementovat, je bootstrapping.
V následujících cvičeních budeš pracovat se známými daty biopics. Cílem je pomocí vícenásobné imputace bootstrappingem a lineární regrese zjistit, zda biografické filmy s ženskou hlavní postavou vydělávají méně než filmy s mužskou postavou.
Začneme napsáním funkce, která vytvoří bootstrap vzorek, imputuje ho a natrénuje model lineární regrese.
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- Ořízni
datatak, aby obsahovala řádky odpovídající indexůmindices, a výsledek ulož dodata_boot. - Imputuj bootstrap vzorek
data_bootpomocí kNN imputace s 5 sousedy a výsledek ulož dodata_imp. - Na datech
data_impnatrénuj model lineární regrese, který vysvětlujeearningspomocí proměnnýchsub_sex,sub_typeayear.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
calc_gender_coef <- function(data, indices) {
# Get bootstrap sample
data_boot <- data[___, ]
# Impute with kNN imputation
data_imp <- ___
# Fit linear regression
linear_model <- ___
# Extract and return gender coefficient
gender_coefficient <- coef(linear_model)[2]
return(gender_coefficient)
}