Błąd wynikający z niedouczenia/przeuczenia
Zbiór danych o cukierkach jest wyjątkowo podatny na przeuczenie. Mając zaledwie 85 obserwacji, przeznaczenie 20% na zbiór testowy oznacza utratę sporej ilości cennych danych, które mogłyby posłużyć do budowy modelu. Wyobraź sobie sytuację, w której większość czekoladowych cukierków trafia do zbioru treningowego, a tylko nieliczne do zbioru walidacyjnego. Model mógłby jedynie wychwycić, że czekolada jest istotnym czynnikiem, nie dostrzegając, że inne atrybuty są równie ważne. W tym ćwiczeniu sprawdzisz, jak użycie zbyt wielu cech (kolumn) w modelu lasów losowych może prowadzić do przeuczenia.
Cecha określa, które kolumny zbioru danych są używane w drzewie decyzyjnym. Parametr max_features ogranicza liczbę dostępnych cech.
To ćwiczenie jest częścią kursu
Walidacja modeli w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Update the rfr model
rfr = RandomForestRegressor(____=25,
____=1111,
____=2)
rfr.fit(X_train, y_train)
# Print the training and testing accuracies
print('The training error is {0:.2f}'.format(
mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
mae(y_test, rfr.predict(X_test))))