Chyba způsobená nedostatečným/nadměrným přizpůsobením
Dataset s cukrovinkami přímo vybízí k přetrénování modelu. Má pouze 85 pozorování, a pokud 20 % vyhradíš na testovací dataset, přijdeš o spoustu cenných dat, která by se dala využít při trénování. Představ si, že většina čokoládových cukrovinek skončí v trénovacích datech a v holdout vzorku jich zbyde jen minimum. Model by pak mohl vidět čokoládu jako klíčový faktor a přehlédnout, že důležité jsou i jiné vlastnosti. V tomto cvičení prozkoumáš, jak příliš mnoho příznaků (sloupců) v modelu náhodného lesa může vést k přetrénování.
Příznak označuje, které sloupce dat se použijí v rozhodovacím stromě. Parametr max_features omezuje počet dostupných příznaků.
Toto cvičení je součástí kurzu
Validace modelů v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Update the rfr model
rfr = RandomForestRegressor(____=25,
____=1111,
____=2)
rfr.fit(X_train, y_train)
# Print the training and testing accuracies
print('The training error is {0:.2f}'.format(
mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
mae(y_test, rfr.predict(X_test))))