ÎncepețiÎncepe gratuit

De la zero la erou

Ai stăpânit deja abilitățile de creare a unei specificații de model și de împărțire a datelor în seturi de antrenament și de testare. Știi, de asemenea, cum să eviți dezechilibrele de clasă în split. Acum e momentul să combini tot ce ai învățat în lecția anterioară și să construiești modelul folosind doar setul de antrenament!

Vei construi un pipeline de machine learning complet. Acesta include crearea unei specificații de model, împărțirea datelor în seturi de antrenament și de testare și, nu în ultimul rând, antrenarea modelului pe datele de antrenament. Mult succes!

Acest exercițiu face parte din cursul

Machine Learning cu modele bazate pe arbori în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează diabetes_split, un split în care setul de antrenament conține trei sferturi din toate rândurile din diabetes și în care setele de antrenament și de testare au o distribuție similară a variabilei outcome.
  • Construiește o specificație de arbore de decizie pentru modelul tău folosind motorul rpart și salvează-o ca tree_spec.
  • Antrenează un model model_trained folosind datele de antrenament din diabetes_split, cu outcome ca variabilă țintă și bmi și skin_thickness ca predictori.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

set.seed(9)

# Create the balanced data split
diabetes_split <- ___

# Build the specification of the model
tree_spec <- ___ %>% 
  ___ %>% 
  ___

# Train the model
model_trained <- ___ %>% 
  fit(___, 
      ___)

model_trained
Editează și rulează codul