Porovnání výkonu modelů
Grafická vizualizace ti dá dobrý přehled o tom, kde model funguje dobře a kde ne. Někdy se ale hodí mít k dispozici číselnou metriku, která model ohodnotí jedním číslem. Díky tomu můžeš kvalitu modelu kvantifikovat a snadno porovnávat více modelů najednou. Běžně používanou metrikou je střední kvadratická chyba (anglicky „root mean square error", zkráceně „RMSE"), která residuály umocní na druhou, vypočítá jejich průměr a z něj pak odmocninu. Čím menší hodnota RMSE, tím lepší předpověď. (Pozor: RMSE nelze přímo porovnávat mezi různými datovými sadami, pouze mezi různými modely na stejné datové sadě. V některých případech je možné datové sady normalizovat a srovnání pak provést.)
Tady porovnáš modely gradient boosted trees a random forest.
Toto cvičení je součástí kurzu
Úvod do Sparku se sparklyr v R
Pokyny k cvičení
both_responses je lokální tibble s předpovězenými a skutečnými roky nahrávek z obou modelů — je už předpřipravený.
- Vytvoř datovou sadu s součtem čtverců reziduálů.
- Přidej sloupec
residualrovný předpovězené hodnotě minus skutečné hodnotě. - Seskup data podle
model. - Vypočítej souhrnnou statistiku
rmsejako odmocninu průměru čtverců hodnotresidual.
- Přidej sloupec
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# both_responses has been pre-defined
both_responses
# Create a residual sum of squares dataset
___