НачатьНачать бесплатно

Прогнозирование кассовых сборов фильмов

Начнём решать задачу прогнозирования кассовых сборов: построим простую линейную регрессию для оценки логарифма выручки фильмов на основе признака 'budget'. В качестве метрики будет использоваться RMSE (среднеквадратичная ошибка). Чтобы вычислить её с помощью scikit-learn, воспользуйтесь функцией mean_squared_error() из модуля sklearn.metrics, а затем извлеките квадратный корень с помощью numpy.

Набор данных movies уже загружен и разбит на обучающую и тестовую выборки. Пропущенные значения заменены нулями, а входной признак стандартизирован с помощью StandardScaler(). Если вы хотите подробнее изучить предобработку данных для машинного обучения, обратитесь к курсам DataCamp по очистке данных и конструированию признаков.

Это упражнение является частью курса

Ансамблевые методы в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте экземпляр модели LinearRegression с параметрами по умолчанию.
  • Вычислите предсказания на тестовой выборке.
  • Рассчитайте RMSE. Функция mean_squared_error() принимает два аргумента: y_test, а затем предсказания.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))
Редактировать и запускать код