Błędy imputacji dla poszczególnych zmiennych
W poprzednim ćwiczeniu wyodrębniono szacunkowe błędy imputacji z wyników funkcji missForest. Otrzymano dwie wartości:
- znormalizowany pierwiastek błędu średniokwadratowego (NRMSE) dla wszystkich zmiennych ciągłych;
- odsetek błędnie sklasyfikowanych obserwacji (PFC) dla wszystkich zmiennych kategorycznych.
Może się jednak zdarzyć, że model imputacji świetnie radzi sobie z jedną zmienną ciągłą, a słabo z inną! Aby wykryć takie przypadki, wystarczy wskazać funkcji missForest, że ma obliczać błędy osobno dla każdej zmiennej. Służy do tego ustawienie argumentu variablewise na TRUE.
Zbiór danych biopics i pakiet missForest zostały już wczytane – przyjrzyjmy się bliżej błędom imputacji!
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Impute biopics data with missForest computing per-variable errors
imp_res <- ___(___, ___ = ___)