Antrenează modelul (modelele)
Ești în sfârșit pregătit să antrenezi modelele și să îl alegi pe cel mai bun!
Din păcate, validarea încrucișată este o procedură foarte costisitoare din punct de vedere computațional. Antrenarea tuturor modelelor ar dura prea mult pe DataCamp.
Pentru a face asta local, ai folosi codul:
# Fit cross validation models
models = cv.fit(training)
# Extract the best model
best_lr = models.bestModel
Reține că datele de antrenament se numesc training și folosești lr pentru a antrena un model de regresie logistică. Validarea încrucișată a selectat valorile parametrilor regParam=0 și elasticNetParam=0 ca fiind cele mai bune. Acestea sunt valorile implicite, deci nu trebuie să faci nimic altceva cu lr înainte de a antrena modelul.
Acest exercițiu face parte din cursul
Fundamente PySpark
Instrucțiuni pentru exercițiu
- Creează
best_lrapelândlr.fit()pe dateletraining. - Afișează
best_lrpentru a verifica că este un obiect al claseiLogisticRegressionModel.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Call lr.fit()
best_lr = ____
# Print best_lr
print(____)