Random Forest: predikce
Teď je čas provést predikce pomocí modelu random forest. Syntaxe je stejná jako u modelu gradient boosted trees.
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
Připojení ke Sparku je předpřipraveno jako spark_conn. Tibbles napojené na trénovací a testovací datové sady uložené ve Sparku jsou předem definovány jako track_data_to_model_tbl a track_data_to_predict_tbl. Model random forest je předem definován jako random_forest_model.
- Definuj proměnnou
predicted, která bude obsahovat predikce modelu pro testovací data.- Zavolej
ml_predict()s modelem a testovacími daty jako argumenty. Tato funkce vygeneruje predikce pro testovací datovou sadu a přidá je jako nový sloupec s názvemprediction.
- Zavolej
- Definuj proměnnou
responses, která připraví data pro porovnání predikovaných hodnot se skutečnými:- Vyber sloupec s odpovědí
year. - Sesbírej výsledky.
- Pomocí
mutate()přidej predikce z proměnnépredicted.
- Vyber sloupec s odpovědí
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___