ÎncepețiÎncepe gratuit

Limitarea dimensiunii eșantionului

O altă metodă pentru a preveni supraadaptarea (overfitting) este să specifici numărul minim de observații necesare pentru a forma o frunză (sau un nod) în arborele de decizie.

În acest exercițiu vei:

  • seta această limită minimă la 100
  • antrena noul model pe datele despre angajați
  • analiza rezultatele predicțiilor atât pe setul de antrenament, cât și pe cel de testare

Variabilele features_train, target_train, features_test și target_test sunt deja disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

HR Analytics: Predicția fluctuației angajaților în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează DecisionTreeClassifier și setează limita minimă a frunzei la 100 de observații
  • Antrenează modelul de arbore de decizie pe datele de antrenament.
  • Verifică acuratețea predicțiilor atât pe setul de antrenament, cât și pe cel de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Initialize the DecisionTreeClassifier while limiting the sample size in leaves to 100
model_sample_100 = DecisionTreeClassifier(____, random_state=42)

# Fit the model
____.fit(features_train,____)

# Print the accuracy of the prediction (in percentage points) for the training set
print(____.score(features_train,target_train)*100)

# Print the accuracy of the prediction (in percentage points) for the test set
print(____.____(features_test,target_test)*100)
Editează și rulează codul