Inne podsumowania brakujących danych
Niektóre podsumowania brakujących danych są szczególnie przydatne w przypadku określonych typów danych. Przykładem są miss_var_span() i miss_var_run().
miss_var_span()oblicza liczbę brakujących wartości w podanej zmiennej dla powtarzającego się przedziału. Jest to bardzo przydatne w danych szeregów czasowych – pozwala szukać tygodniowych (7-dniowych) wzorców brakujących danych.miss_var_run()oblicza liczbę „serii" lub „ciągów" brakujących wartości. Przydaje się do wykrywania nietypowych wzorców braków – na przykład powtarzającego się schematu: 5 kompletnych wartości i 5 brakujących.
Obie funkcje, miss_var_span() i miss_var_run(), działają z operatorem group_by z pakietu dplyr.
To ćwiczenie jest częścią kursu
Praca z brakującymi danymi w R
Instrukcje do ćwiczenia
Korzystając ze zbioru danych pedestrian z pakietu naniar:
- Oblicz podsumowania brakujących wartości dla zmiennych w zbiorze danych, używając
miss_var_span()z przedziałem równym 4000. - Oblicz podsumowania brakujących wartości dla obserwacji w zbiorze danych, używając
miss_var_run(). - Połącz wyniki z operatorem
group_byz pakietudplyr, grupując według zmiennejmonth.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Calculate the summaries for each run of missingness for the variable, hourly_counts
miss_var_run(pedestrian, var = ___)
# Calculate the summaries for each span of missingness,
# for a span of 4000, for the variable hourly_counts
miss_var_span(pedestrian, var = ___, span_every = ___)
# For each `month` variable, calculate the run of missingness for hourly_counts
pedestrian %>% group_by(month) %>% ___()
# For each `month` variable, calculate the span of missingness
# of a span of 2000, for the variable hourly_counts
pedestrian %>% group_by(___) %>% ___(var = ___, span_every = ___)