Rozdělení na trénovací a testovací sadu
Aby ses mohl/a přesvědčit, jak dobře model funguje, je potřeba ho trénovat a testovat na dvou různých částech dat – jinak by to bylo jako podvádět u zkoušky (když znáš odpovědi předem).
Rozdělení dat je nedílnou součástí procesu modelování. Procvičíš si ho na datech o diabetu a ověříš, že jsou výsledné proporce správné.
Data diabetes z předchozího cvičení jsou předem načtena v tvém pracovním prostředí.
Toto cvičení je součástí kurzu
Machine Learning with Tree-Based Models in R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create the split
diabetes_split <- ___(___, prop = ___)
# Print the data split
___