Random Forest: tvorba modelu
Stejně jako gradientní boosting jsou i náhodné lesy (random forests) formou ansámblového modelu. To znamená, že kombinují velké množství jednodušších modelů (opět rozhodovacích stromů) do jednoho výkonnějšího celku. Na rozdíl od iterativního přístupu ale náhodné lesy spouštějí mnoho samostatných modelů paralelně — každý na náhodně vybrané podmnožině dat a náhodně vybrané podmnožině příznaků. Výsledný model pak vytváří predikce agregací výstupů jednotlivých modelů.
Funkce pro náhodné lesy v sparklyr se jmenuje ml_random_forest(). Její použití je úplně stejné jako u ml_gradient_boosted_trees() (připomenutí syntaxe najdeš v prvním cvičení této kapitoly).
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojený na kombinovaná a filtrovaná metadata skladeb spolu s timbre daty uloženými ve Sparku je předem definován jako track_data_to_model_tbl.
- Zopakuj analýzu predikce roku, tentokrát pomocí modelu náhodného lesa.
- Získej sloupce
timbreztrack_data_to_model_tbla výsledek ulož dofeature_colnames. - Vytvoř vzorec pro model pomocí
reformulate(). - Spusť model náhodného lesa a výsledek ulož do
random_forest_model.
- Získej sloupce
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___