Sztuczki i wskazówki dotyczące hot-deck II: sortowanie według skorelowanych zmiennych
Kolejnym trikiem, który może poprawić wyniki imputacji metodą hot-deck, jest posortowanie danych według zmiennych skorelowanych z tą, którą chcemy uzupełnić.
Na przykład na wszystkich wykresach marginalnych, które ostatnio tworzyłeś, widać wyraźnie, że temperatura powietrza jest silnie skorelowana z temperaturą powierzchni morza – co ma intuicyjny sens. Możesz wykorzystać tę wiedzę, aby ulepszyć imputację metodą hot-deck. Jeśli najpierw posortujemy dane według sea_surface_temp, każda uzupełniona wartość air_temp będzie pochodzić od dawcy o podobnej wartości sea_surface_temp. Sprawdźmy, jak to działa w praktyce!
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Instrukcje do ćwiczenia
- Wykonaj imputację metodą hot-deck dla brakujących wartości
air_tempw zbiorze danychtao, sortując dane wedługsea_surface_temp, i przypisz wynik do zmiennejtao_imp. - Stwórz wykres marginalny dla
air_tempisea_surface_temp.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Hot-deck-impute air_temp in tao ordering by sea_surface_temp
tao_imp <- ___(___, ___ = ___, ___ = ___)
# Draw a margin plot of air_temp vs sea_surface_temp
tao_imp %>%
select(air_temp, sea_surface_temp, air_temp_imp) %>%
___(___ = ___)