Začněte nyníZačněte zdarma

Random Forest: tvorba modelu

Stejně jako gradientní boosting jsou i náhodné lesy (random forests) formou ansámblového modelu. To znamená, že kombinují velké množství jednodušších modelů (opět rozhodovacích stromů) do jednoho výkonnějšího celku. Na rozdíl od iterativního přístupu ale náhodné lesy spouštějí mnoho samostatných modelů paralelně — každý na náhodně vybrané podmnožině dat a náhodně vybrané podmnožině příznaků. Výsledný model pak vytváří predikce agregací výstupů jednotlivých modelů.

Funkce pro náhodné lesy v sparklyr se jmenuje ml_random_forest(). Její použití je úplně stejné jako u ml_gradient_boosted_trees() (připomenutí syntaxe najdeš v prvním cvičení této kapitoly).

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Spark připojení je pro tebe připraveno jako spark_conn. Tibble napojený na kombinovaná a filtrovaná metadata skladeb spolu s timbre daty uloženými ve Sparku je předem definován jako track_data_to_model_tbl.

  • Zopakuj analýzu predikce roku, tentokrát pomocí modelu náhodného lesa.
    • Získej sloupce timbre z track_data_to_model_tbl a výsledek ulož do feature_colnames.
    • Vytvoř vzorec pro model pomocí reformulate().
    • Spusť model náhodného lesa a výsledek ulož do random_forest_model.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl

# Get the timbre columns
feature_colnames <- ___

# Create the formula for the model
year_formula <- ___

# Run the random forest model
random_forest_model <- ___
Upravit a spustit kód