Imputacja z użyciem lasów losowych
Podejście do imputacji oparte na uczeniu maszynowym może być zarówno dokładniejsze, jak i prostsze w implementacji niż tradycyjne modele statystyczne. Po pierwsze, nie wymaga ręcznego określania zależności między zmiennymi. Co więcej, modele uczenia maszynowego, takie jak lasy losowe, potrafią wykrywać złożone, nieliniowe relacje i wykorzystywać je do przewidywania brakujących wartości.
W tym ćwiczeniu poznasz pakiet missForest, który buduje osobny las losowy do przewidywania brakujących wartości dla każdej zmiennej z osobna. Wywołasz funkcję imputacji na zbiorze danych o filmach biograficznych – biopics – z którym pracowałeś wcześniej w kursie, a następnie wyodrębnisz uzupełnione dane oraz szacowane błędy imputacji.
Czas posadzić trochę lasów losowych!
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Instrukcje do ćwiczenia
- Wczytaj pakiet
missForest. - Użyj funkcji
missForest(), aby uzupełnić brakujące wartości w zbiorze danychbiopics; przypisz wynik doimp_res. - Wyodrębnij uzupełniony zbiór danych z
imp_res, przypisz go doimp_datai sprawdź, czy liczba brakujących wartości wynosi rzeczywiście zero. - Wyodrębnij szacowany błąd imputacji z
imp_res, przypisz go doimp_erri wyświetl w konsoli.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)