t-test pro MAR: příprava dat
Skvělá práce při klasifikaci mechanismů chybějících dat v předchozím cvičení! Ze všech tří je MAR pravděpodobně nejdůležitější mechanismus k odhalení, protože mnoho imputačních metod předpokládá, že data jsou MAR. Toto cvičení se proto zaměří na testování přítomnosti MAR.
Budeš pracovat se známým datasetem biopics. Cílem je otestovat, zda se počet chybějících hodnot v proměnné earnings liší podle pohlaví subjektu. V tomto cvičení pouze připravíš data pro t-test. Nejprve vytvoříš dummy proměnnou označující chybějící hodnoty v earnings. Pak ji rozdělíš podle pohlaví tak, že data nejprve vyfiltuješ na jedno pohlaví a poté z nich pomocí pull() extrakuješ dummy proměnnou. Pro filtrování může být užitečné vypsat head() datasetu biopics do konzole a prohlédnout si proměnnou pohlaví.
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Pokyny k cvičení
- Přidej do datasetu
biopicsnovou proměnnoumissing_earnings, která bude mít hodnotuTRUE, pokudearningschybí, aFALSEv opačném případě. - Vytvoř vektor hodnot
missing_earningspro muže a přiřaď ho do proměnnémissing_earnings_males. - Vytvoř vektor hodnot
missing_earningspro ženy a přiřaď ho do proměnnémissing_earnings_females.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a dummy variable for missing earnings
biopics <- biopics %>%
___(missing_earnings = ___(___))
# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>%
___(___) %>%
___(___)
# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>%
___(___) %>%
___(___)