De la zero la erou
Ai stăpânit deja abilitățile de creare a unei specificații de model și de împărțire a datelor în seturi de antrenament și de testare. Știi, de asemenea, cum să eviți dezechilibrele de clasă în split. Acum e momentul să combini tot ce ai învățat în lecția anterioară și să construiești modelul folosind doar setul de antrenament!
Vei construi un pipeline de machine learning complet. Acesta include crearea unei specificații de model, împărțirea datelor în seturi de antrenament și de testare și, nu în ultimul rând, antrenarea modelului pe datele de antrenament. Mult succes!
Acest exercițiu face parte din cursul
Machine Learning cu modele bazate pe arbori în R
Instrucțiuni pentru exercițiu
- Creează
diabetes_split, un split în care setul de antrenament conține trei sferturi din toate rândurile dindiabetesși în care setele de antrenament și de testare au o distribuție similară a variabileioutcome. - Construiește o specificație de arbore de decizie pentru modelul tău folosind motorul
rpartși salvează-o catree_spec. - Antrenează un model
model_trainedfolosind datele de antrenament dindiabetes_split, cuoutcomeca variabilă țintă șibmișiskin_thicknessca predictori.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained