ÎncepețiÎncepe gratuit

Tăierea arborelui

Supraadaptarea (overfitting) este o problemă clasică în analiză, mai ales în cazul algoritmului arborelui de decizie. Odată ce arborele este complet crescut, poate oferi predicții foarte precise pe setul de antrenament, însă performanța sa pe setul de testare poate fi semnificativ mai slabă. Din acest motiv, creșterea arborelui de decizie este de obicei controlată prin:

  • „Tăierea" arborelui și stabilirea unei limite pentru adâncimea maximă pe care o poate atinge.
  • Limitarea numărului minim de observații dintr-o frunză a arborelui.

În acest exercițiu, vei:

  • tăia arborele și limita creșterea acestuia la 5 niveluri de adâncime
  • antrena modelul pe datele angajaților
  • testa rezultatele predicțiilor atât pe setul de antrenament, cât și pe cel de testare.

Variabilele features_train, target_train, features_test și target_test sunt deja disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

HR Analytics: Predicția fluctuației angajaților în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează DecisionTreeClassifier limitând adâncimea arborelui la 5.
  • Antrenează modelul de arbore de decizie folosind caracteristicile (features) și ținta (target) din setul de antrenament.
  • Verifică acuratețea predicțiilor atât pe setul de antrenament, cât și pe cel de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Initialize the DecisionTreeClassifier while limiting the depth of the tree to 5
model_depth_5 = DecisionTreeClassifier(____=5, random_state=42)

# Fit the model
____.fit(features_train,target_train)

# Print the accuracy of the prediction for the training set
print(____.____(features_train,target_train)*100)

# Print the accuracy of the prediction for the test set
print(model_depth_5.score(____,____)*100)
Editează și rulează codul