Kom igångKom igång gratis

t-test för MAR: förberedelse av data

Bra jobbat med att klassificera de saknade datamekanismerna i föregående övning! Av de tre är MAR utan tvekan den viktigaste att identifiera, eftersom många imputationsmetoder förutsätter att datan är MAR. Den här övningen fokuserar därför på att testa för MAR.

Du kommer att arbeta med den bekanta datamängden biopics. Målet är att testa om antalet saknade värden i earnings skiljer sig åt beroende på ämnesobjektets kön. I den här övningen förbereder du enbart datan inför t-testet. Först skapar du en dummyvariabel som indikerar saknade värden i earnings. Sedan delar du upp datan per kön – genom att filtrera fram ett kön i taget och sedan hämta ut dummyvariabeln med pull(). Det kan vara bra att skriva ut head() av biopics i konsolen och undersöka könsvariabeln innan du börjar filtrera.

Den här övningen är en del av kursen

Hantering av saknade värden med imputering i R

Visa kurs

Övningsinstruktioner

  • Lägg till en ny variabel i biopics som heter missing_earnings. Den ska vara TRUE om earnings saknas och FALSE annars.
  • Skapa en vektor med missing_earnings-värden för män och tilldela den till missing_earnings_males.
  • Skapa en vektor med missing_earnings-värden för kvinnor och tilldela den till missing_earnings_females.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a dummy variable for missing earnings
biopics <- biopics %>% 
  ___(missing_earnings = ___(___))

# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>% 
  ___(___) %>% 
  ___(___)

# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>% 
  ___(___) %>% 
  ___(___)
Redigera och kör kod