Обмеження розміру вибірки
Інший спосіб уникнути перенавчання — задати мінімальну кількість спостережень, необхідних для розростання листка (або вузла) у рішальному дереві.
У цій вправі ви:
- встановите цей мінімальний поріг у 100
- навчите нову модель на даних про співробітників
- перевірите результати передбачення на тренувальній і тестовій вибірках
Змінні features_train, target_train, features_test і target_test вже доступні у вашому робочому середовищі.
Ця вправа є частиною курсу
HR Analytics: прогнозування плинності персоналу в Python
Інструкції до вправи
- Ініціалізуйте
DecisionTreeClassifierі встановіть мінімальний поріг для листка у 100 спостережень - Навчіть модель рішального дерева на тренувальних даних.
- Перевірте точність передбачень як на тренувальній, так і на тестовій вибірках.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Initialize the DecisionTreeClassifier while limiting the sample size in leaves to 100
model_sample_100 = DecisionTreeClassifier(____, random_state=42)
# Fit the model
____.fit(features_train,____)
# Print the accuracy of the prediction (in percentage points) for the training set
print(____.score(features_train,target_train)*100)
# Print the accuracy of the prediction (in percentage points) for the test set
print(____.____(features_test,target_test)*100)