Kom igångKom igång gratis

Fel på grund av under- och överanpassning

Godisdatasetet är en utmärkt kandidat för överanpassning. Med bara 85 observationer förlorar du en stor mängd värdefull data om du använder 20 % för testdatasetet – data som annars hade kunnat användas för modellering. Tänk dig ett scenario där de flesta chokladgodisarna hamnar i träningsdatan och väldigt få i valideringsurvalet. Modellen kanske enbart uppfattar att choklad är en avgörande faktor, och missar att andra egenskaper också spelar roll. I den här övningen undersöker du hur för många särdrag (kolumner) i en slumpskogsmodell kan leda till överanpassning.

Ett särdrag anger vilka kolumner i datan som används i ett beslutsträd. Parametern max_features begränsar antalet tillgängliga särdrag.

Den här övningen är en del av kursen

Modellvalidering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
Redigera och kör kod