Začněte nyníZačněte zdarma

Chyba způsobená nedostatečným/nadměrným přizpůsobením

Dataset s cukrovinkami přímo vybízí k přetrénování modelu. Má pouze 85 pozorování, a pokud 20 % vyhradíš na testovací dataset, přijdeš o spoustu cenných dat, která by se dala využít při trénování. Představ si, že většina čokoládových cukrovinek skončí v trénovacích datech a v holdout vzorku jich zbyde jen minimum. Model by pak mohl vidět čokoládu jako klíčový faktor a přehlédnout, že důležité jsou i jiné vlastnosti. V tomto cvičení prozkoumáš, jak příliš mnoho příznaků (sloupců) v modelu náhodného lesa může vést k přetrénování.

Příznak označuje, které sloupce dat se použijí v rozhodovacím stromě. Parametr max_features omezuje počet dostupných příznaků.

Toto cvičení je součástí kurzu

Validace modelů v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
Upravit a spustit kód