Začněte nyníZačněte zdarma

Random Forest: predikce

Teď je čas provést predikce pomocí modelu random forest. Syntaxe je stejná jako u modelu gradient boosted trees.

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

Připojení ke Sparku je předpřipraveno jako spark_conn. Tibbles napojené na trénovací a testovací datové sady uložené ve Sparku jsou předem definovány jako track_data_to_model_tbl a track_data_to_predict_tbl. Model random forest je předem definován jako random_forest_model.

  • Definuj proměnnou predicted, která bude obsahovat predikce modelu pro testovací data.
    • Zavolej ml_predict() s modelem a testovacími daty jako argumenty. Tato funkce vygeneruje predikce pro testovací datovou sadu a přidá je jako nový sloupec s názvem prediction.
  • Definuj proměnnou responses, která připraví data pro porovnání predikovaných hodnot se skutečnými:
    • Vyber sloupec s odpovědí year.
    • Sesbírej výsledky.
    • Pomocí mutate() přidej predikce z proměnné predicted.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model

# Predict the responses for the testing data
predicted <- ml_predict(
      ___,
      ___) %>% pull(prediction)

# Create a response vs. actual dataset
responses <- ___
Upravit a spustit kód