Výpočet výkonu pomocí křížové validace
Při optimalizaci modelů je zásadní vybrat správnou metriku, která odpovídá cíli modelu.
Představ si, že chceš tento model použít k identifikaci zaměstnanců, u nichž se předpokládá odchod z firmy. Ideálně chceš model, který zachytí co nejvíce takových zaměstnanců, abys mohl/a včas zasáhnout. Metrika, která toto měří, se nazývá recall. Proto budeš k optimalizaci a výběru modelů používat výhradně recall.
Toto cvičení je součástí kurzu
Machine Learning in the Tidyverse
Pokyny k cvičení
- Vypočítej recall porovnáním skutečných a předpovězených odpovědí pro každý fold a výsledek ulož do sloupce
validate_recall. - Vypiš sloupec
validate_recall. - Vypiš průměr tohoto sloupce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_lr %>%
mutate(validate_recall = map2_dbl(___, ___,
~recall(actual = .x, predicted = .y)))
# Print the validate_recall column
cv_perf_recall$___
# Calculate the average of the validate_recall column
___