НачатьНачать бесплатно

Ошибка из-за недообучения и переобучения

Набор данных о конфетах легко поддаётся переобучению. В нём всего 85 наблюдений, и если выделить 20% под тестовую выборку, большая часть ценных данных окажется недоступной для обучения модели. Представьте ситуацию: большинство шоколадных конфет попало в обучающую выборку, а в отложенной их почти нет. Тогда модель может «решить», что шоколад — единственный важный фактор, и не заметить другие значимые признаки. В этом упражнении вы изучите, как использование слишком большого числа признаков (столбцов) в модели случайного леса приводит к переобучению.

Признак определяет, какие столбцы данных используются в дереве решений. Параметр max_features ограничивает количество доступных признаков.

Это упражнение является частью курса

Валидация моделей на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
Редактировать и запускать код