Test t dla MAR: przygotowanie danych
Świetna robota z klasyfikowaniem mechanizmów brakujących danych w poprzednim ćwiczeniu! Spośród wszystkich trzech mechanizmów MAR jest prawdopodobnie najważniejszym do wykrycia – wiele metod imputacji zakłada bowiem, że dane są MAR. To ćwiczenie skupia się właśnie na testowaniu tego mechanizmu.
Będziesz pracować ze znajomym zbiorem danych biopics. Celem jest sprawdzenie, czy liczba brakujących wartości w zmiennej earnings różni się w zależności od płci osoby, której dotyczy biogram. W tym ćwiczeniu przygotujesz dane do testu t. Najpierw utworzysz zmienną zastępczą (ang. dummy variable) wskazującą na brakujące wartości w earnings. Następnie podzielisz dane według płci – filtrując zbiór tak, aby zachować jedną płeć, a potem wyciągając zmienną zastępczą. Przy filtrowaniu warto wyświetlić w konsoli funkcję head() na zbiorze biopics i przyjrzeć się zmiennej opisującej płeć.
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Instrukcje do ćwiczenia
- Dodaj do zbioru
biopicsnową zmiennąmissing_earnings, która przyjmuje wartośćTRUE, jeśli wearningsbrakuje danych, iFALSEw przeciwnym wypadku. - Utwórz wektor wartości
missing_earningsdla mężczyzn i przypisz go do zmiennejmissing_earnings_males. - Utwórz wektor wartości
missing_earningsdla kobiet i przypisz go do zmiennejmissing_earnings_females.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a dummy variable for missing earnings
biopics <- biopics %>%
___(missing_earnings = ___(___))
# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>%
___(___) %>%
___(___)
# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>%
___(___) %>%
___(___)