Kompromis mezi rychlostí a přesností
V poslední ukázce jsi viděl/a, že existují dva parametry, které můžeš ladit a ovlivnit tak výkon náhodných lesů:
- Počet rozhodovacích stromů v každém lese.
- Počet proměnných použitých pro větvení uvnitř rozhodovacích stromů.
Zvýšení každého z nich může zlepšit přesnost imputačního modelu, ale zároveň si vyžádá více času na výpočet. V tomto cvičení si tyto myšlenky ověříš sám/a – spustíš missForest() na datech biopics dvakrát s různými nastaveními. Při plnění pokynů sleduj hodnoty chyb, které se vypíší, a také jak dlouho kód běží.
Toto cvičení je součástí kurzu
Práce s chybějícími daty pomocí imputace v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set number of trees to 5 and number of variables used for splitting to 2
imp_res <- missForest(biopics, ___ = ___, ___ = ___)
# Print the resulting imputation errors
print(___)