Od nuly k hrdinovi
Už ovládáš tvorbu specifikace modelu i rozdělení dat na trénovací a testovací sady. Víš také, jak předejít nerovnoměrnému zastoupení tříd při splitu. Teď je čas spojit vše, co jsi se v předchozí lekci naučil/a, a sestavit model pouze na trénovacích datech!
Budeš budovat skutečný machine learning pipeline. Ten se skládá z vytvoření specifikace modelu, rozdělení dat na trénovací a testovací sadu a v neposlední řadě z natrénování modelu na trénovacích datech. Jdeme na to!
Toto cvičení je součástí kurzu
Machine Learning with Tree-Based Models in R
Pokyny k cvičení
- Vytvoř
diabetes_split— split, ve kterém trénovací sada obsahuje tři čtvrtiny všech řádků datasetudiabetesa kde mají trénovací i testovací sada podobné rozložení hodnot proměnnéoutcome. - Vytvoř specifikaci rozhodovacího stromu pro svůj model s použitím enginu
rparta ulož ji jakotree_spec. - Natrénuj model
model_trainedna trénovacích datech zediabetes_split, kdeoutcomeje cílová proměnná abmiaskin_thicknessjsou prediktory.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained