Test t pentru MAR: pregătirea datelor
Felicitări pentru clasificarea mecanismelor de date lipsă din exercițiul anterior! Dintre cele trei, MAR este, fără îndoială, cel mai important de detectat, deoarece multe metode de imputare presupun că datele sunt MAR. Prin urmare, acest exercițiu se va concentra pe testarea pentru MAR.
Vei lucra cu setul de date biopics, pe care îl cunoști deja. Scopul este să testezi dacă numărul de valori lipsă din earnings diferă în funcție de genul subiectului. În acest exercițiu, vei pregăti doar datele pentru testul t. Mai întâi, vei crea o variabilă dummy care indică valorile lipsă din earnings. Apoi, o vei împărți pe gen, filtrând datele pentru a păstra un singur gen și extragând variabila dummy. Pentru filtrare, poate fi util să afișezi head() al setului biopics în consolă și să examinezi variabila de gen.
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă prin imputare în R
Instrucțiuni pentru exercițiu
- Adaugă o nouă variabilă în
biopics, numitămissing_earnings, care să fieTRUEdacăearningslipsește șiFALSEîn caz contrar. - Creează un vector de valori
missing_earningspentru bărbați și atribuie-l variabileimissing_earnings_males. - Creează un vector de valori
missing_earningspentru femei și atribuie-l variabileimissing_earnings_females.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a dummy variable for missing earnings
biopics <- biopics %>%
___(missing_earnings = ___(___))
# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>%
___(___) %>%
___(___)
# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>%
___(___) %>%
___(___)