Ошибка из-за недообучения и переобучения
Набор данных о конфетах легко поддаётся переобучению. В нём всего 85 наблюдений, и если выделить 20% под тестовую выборку, большая часть ценных данных окажется недоступной для обучения модели. Представьте ситуацию: большинство шоколадных конфет попало в обучающую выборку, а в отложенной их почти нет. Тогда модель может «решить», что шоколад — единственный важный фактор, и не заметить другие значимые признаки. В этом упражнении вы изучите, как использование слишком большого числа признаков (столбцов) в модели случайного леса приводит к переобучению.
Признак определяет, какие столбцы данных используются в дереве решений. Параметр max_features ограничивает количество доступных признаков.
Это упражнение является частью курса
Валидация моделей на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Update the rfr model
rfr = RandomForestRegressor(____=25,
____=1111,
____=2)
rfr.fit(X_train, y_train)
# Print the training and testing accuracies
print('The training error is {0:.2f}'.format(
mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
mae(y_test, rfr.predict(X_test))))