Začněte nyníZačněte zdarma

Zabalení imputace a modelování do funkce

Kdykoli provádíš analýzu nebo modelování na imputovaných datech, měl/a bys zohlednit nejistotu plynoucí z imputace. Spuštění modelu na datech imputovaných pouze jednou pomíjí skutečnost, že imputace odhaduje chybějící hodnoty s určitou mírou nejistoty. Standardní chyby takového modelu bývají příliš malé. Řešením je vícenásobná imputace – jedním ze způsobů, jak ji implementovat, je bootstrapping.

V následujících cvičeních budeš pracovat se známými daty biopics. Cílem je pomocí vícenásobné imputace bootstrappingem a lineární regrese zjistit, zda biografické filmy s ženskou hlavní postavou vydělávají méně než filmy s mužskou postavou.

Začneme napsáním funkce, která vytvoří bootstrap vzorek, imputuje ho a natrénuje model lineární regrese.

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • Ořízni data tak, aby obsahovala řádky odpovídající indexům indices, a výsledek ulož do data_boot.
  • Imputuj bootstrap vzorek data_boot pomocí kNN imputace s 5 sousedy a výsledek ulož do data_imp.
  • Na datech data_imp natrénuj model lineární regrese, který vysvětluje earnings pomocí proměnných sub_sex, sub_type a year.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

calc_gender_coef <- function(data, indices) {
  # Get bootstrap sample
  data_boot <- data[___, ]
  # Impute with kNN imputation
  data_imp <- ___
  # Fit linear regression
  linear_model <- ___
  # Extract and return gender coefficient
  gender_coefficient <- coef(linear_model)[2]
  return(gender_coefficient)
}
Upravit a spustit kód