Kompromis między szybkością a dokładnością
W ostatnim filmie widziałeś, że istnieją dwa parametry, którymi możesz sterować, aby wpłynąć na wydajność lasów losowych:
- Liczba drzew decyzyjnych w każdym lesie.
- Liczba zmiennych używanych do podziałów w drzewach decyzyjnych.
Zwiększenie każdego z nich może poprawić dokładność modelu imputacji, ale jednocześnie wydłuży czas działania. W tym ćwiczeniu samodzielnie zbadasz te zależności, dopasowując missForest() do danych biopics dwukrotnie z różnymi ustawieniami. Wykonując kolejne kroki, zwróć uwagę na wyświetlane błędy oraz czas potrzebny do wykonania kodu.
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set number of trees to 5 and number of variables used for splitting to 2
imp_res <- missForest(biopics, ___ = ___, ___ = ___)
# Print the resulting imputation errors
print(___)