Začněte nyníZačněte zdarma

t-test pro MAR: příprava dat

Skvělá práce při klasifikaci mechanismů chybějících dat v předchozím cvičení! Ze všech tří je MAR pravděpodobně nejdůležitější mechanismus k odhalení, protože mnoho imputačních metod předpokládá, že data jsou MAR. Toto cvičení se proto zaměří na testování přítomnosti MAR.

Budeš pracovat se známým datasetem biopics. Cílem je otestovat, zda se počet chybějících hodnot v proměnné earnings liší podle pohlaví subjektu. V tomto cvičení pouze připravíš data pro t-test. Nejprve vytvoříš dummy proměnnou označující chybějící hodnoty v earnings. Pak ji rozdělíš podle pohlaví tak, že data nejprve vyfiltuješ na jedno pohlaví a poté z nich pomocí pull() extrakuješ dummy proměnnou. Pro filtrování může být užitečné vypsat head() datasetu biopics do konzole a prohlédnout si proměnnou pohlaví.

Toto cvičení je součástí kurzu

Práce s chybějícími daty pomocí imputace v R

Zobrazit kurz

Pokyny k cvičení

  • Přidej do datasetu biopics novou proměnnou missing_earnings, která bude mít hodnotu TRUE, pokud earnings chybí, a FALSE v opačném případě.
  • Vytvoř vektor hodnot missing_earnings pro muže a přiřaď ho do proměnné missing_earnings_males.
  • Vytvoř vektor hodnot missing_earnings pro ženy a přiřaď ho do proměnné missing_earnings_females.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a dummy variable for missing earnings
biopics <- biopics %>% 
  ___(missing_earnings = ___(___))

# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>% 
  ___(___) %>% 
  ___(___)

# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>% 
  ___(___) %>% 
  ___(___)
Upravit a spustit kód