Začněte nyníZačněte zdarma

Od nuly k hrdinovi

Už ovládáš tvorbu specifikace modelu i rozdělení dat na trénovací a testovací sady. Víš také, jak předejít nerovnoměrnému zastoupení tříd při splitu. Teď je čas spojit vše, co jsi se v předchozí lekci naučil/a, a sestavit model pouze na trénovacích datech!

Budeš budovat skutečný machine learning pipeline. Ten se skládá z vytvoření specifikace modelu, rozdělení dat na trénovací a testovací sadu a v neposlední řadě z natrénování modelu na trénovacích datech. Jdeme na to!

Toto cvičení je součástí kurzu

Machine Learning with Tree-Based Models in R

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř diabetes_split — split, ve kterém trénovací sada obsahuje tři čtvrtiny všech řádků datasetu diabetes a kde mají trénovací i testovací sada podobné rozložení hodnot proměnné outcome.
  • Vytvoř specifikaci rozhodovacího stromu pro svůj model s použitím enginu rpart a ulož ji jako tree_spec.
  • Natrénuj model model_trained na trénovacích datech ze diabetes_split, kde outcome je cílová proměnná a bmi a skin_thickness jsou prediktory.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

set.seed(9)

# Create the balanced data split
diabetes_split <- ___

# Build the specification of the model
tree_spec <- ___ %>% 
  ___ %>% 
  ___

# Train the model
model_trained <- ___ %>% 
  fit(___, 
      ___)

model_trained
Upravit a spustit kód