ÎncepețiÎncepe gratuit

Test t pentru MAR: pregătirea datelor

Felicitări pentru clasificarea mecanismelor de date lipsă din exercițiul anterior! Dintre cele trei, MAR este, fără îndoială, cel mai important de detectat, deoarece multe metode de imputare presupun că datele sunt MAR. Prin urmare, acest exercițiu se va concentra pe testarea pentru MAR.

Vei lucra cu setul de date biopics, pe care îl cunoști deja. Scopul este să testezi dacă numărul de valori lipsă din earnings diferă în funcție de genul subiectului. În acest exercițiu, vei pregăti doar datele pentru testul t. Mai întâi, vei crea o variabilă dummy care indică valorile lipsă din earnings. Apoi, o vei împărți pe gen, filtrând datele pentru a păstra un singur gen și extragând variabila dummy. Pentru filtrare, poate fi util să afișezi head() al setului biopics în consolă și să examinezi variabila de gen.

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă prin imputare în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Adaugă o nouă variabilă în biopics, numită missing_earnings, care să fie TRUE dacă earnings lipsește și FALSE în caz contrar.
  • Creează un vector de valori missing_earnings pentru bărbați și atribuie-l variabilei missing_earnings_males.
  • Creează un vector de valori missing_earnings pentru femei și atribuie-l variabilei missing_earnings_females.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a dummy variable for missing earnings
biopics <- biopics %>% 
  ___(missing_earnings = ___(___))

# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>% 
  ___(___) %>% 
  ___(___)

# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>% 
  ___(___) %>% 
  ___(___)
Editează și rulează codul