Začněte nyníZačněte zdarma

Porovnání výkonu modelů

Grafická vizualizace ti dá dobrý přehled o tom, kde model funguje dobře a kde ne. Někdy se ale hodí mít k dispozici číselnou metriku, která model ohodnotí jedním číslem. Díky tomu můžeš kvalitu modelu kvantifikovat a snadno porovnávat více modelů najednou. Běžně používanou metrikou je střední kvadratická chyba (anglicky „root mean square error", zkráceně „RMSE"), která residuály umocní na druhou, vypočítá jejich průměr a z něj pak odmocninu. Čím menší hodnota RMSE, tím lepší předpověď. (Pozor: RMSE nelze přímo porovnávat mezi různými datovými sadami, pouze mezi různými modely na stejné datové sadě. V některých případech je možné datové sady normalizovat a srovnání pak provést.)

Tady porovnáš modely gradient boosted trees a random forest.

Toto cvičení je součástí kurzu

Úvod do Sparku se sparklyr v R

Zobrazit kurz

Pokyny k cvičení

both_responses je lokální tibble s předpovězenými a skutečnými roky nahrávek z obou modelů — je už předpřipravený.

  • Vytvoř datovou sadu s součtem čtverců reziduálů.
    • Přidej sloupec residual rovný předpovězené hodnotě minus skutečné hodnotě.
    • Seskup data podle model.
    • Vypočítej souhrnnou statistiku rmse jako odmocninu průměru čtverců hodnot residual.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# both_responses has been pre-defined
both_responses

# Create a residual sum of squares dataset
___
Upravit a spustit kód