Fel på grund av under- och överanpassning
Godisdatasetet är en utmärkt kandidat för överanpassning. Med bara 85 observationer förlorar du en stor mängd värdefull data om du använder 20 % för testdatasetet – data som annars hade kunnat användas för modellering. Tänk dig ett scenario där de flesta chokladgodisarna hamnar i träningsdatan och väldigt få i valideringsurvalet. Modellen kanske enbart uppfattar att choklad är en avgörande faktor, och missar att andra egenskaper också spelar roll. I den här övningen undersöker du hur för många särdrag (kolumner) i en slumpskogsmodell kan leda till överanpassning.
Ett särdrag anger vilka kolumner i datan som används i ett beslutsträd. Parametern max_features begränsar antalet tillgängliga särdrag.
Den här övningen är en del av kursen
Modellvalidering i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Update the rfr model
rfr = RandomForestRegressor(____=25,
____=1111,
____=2)
rfr.fit(X_train, y_train)
# Print the training and testing accuracies
print('The training error is {0:.2f}'.format(
mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
mae(y_test, rfr.predict(X_test))))