Eroare din cauza sub/supra-antrenării
Setul de date despre bomboane este predispus la supra-antrenare (overfitting). Cu doar 85 de observații, dacă folosești 20% pentru setul de testare, pierzi o cantitate semnificativă de date valoroase care ar putea fi utilizate la antrenarea modelului. Imaginează-ți scenariul în care majoritatea bomboanelor cu ciocolată ajung în setul de antrenament, iar foarte puține în eșantionul de validare. Modelul ar putea doar să identifice ciocolata ca factor esențial, ratând alte atribute importante. În acest exercițiu, vei explora cum utilizarea prea multor caracteristici (coloane) într-un model de pădure aleatorie poate duce la supra-antrenare.
O caracteristică reprezintă coloanele din date folosite într-un arbore de decizie. Parametrul max_features limitează numărul de caracteristici disponibile.
Acest exercițiu face parte din cursul
Validarea modelelor în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Update the rfr model
rfr = RandomForestRegressor(____=25,
____=1111,
____=2)
rfr.fit(X_train, y_train)
# Print the training and testing accuracies
print('The training error is {0:.2f}'.format(
mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
mae(y_test, rfr.predict(X_test))))