Прогнозирование кассовых сборов фильмов
Начнём решать задачу прогнозирования кассовых сборов: построим простую линейную регрессию для оценки логарифма выручки фильмов на основе признака 'budget'. В качестве метрики будет использоваться RMSE (среднеквадратичная ошибка). Чтобы вычислить её с помощью scikit-learn, воспользуйтесь функцией mean_squared_error() из модуля sklearn.metrics, а затем извлеките квадратный корень с помощью numpy.
Набор данных movies уже загружен и разбит на обучающую и тестовую выборки. Пропущенные значения заменены нулями, а входной признак стандартизирован с помощью StandardScaler(). Если вы хотите подробнее изучить предобработку данных для машинного обучения, обратитесь к курсам DataCamp по очистке данных и конструированию признаков.
Это упражнение является частью курса
Ансамблевые методы в Python
Инструкции к упражнению
- Создайте экземпляр модели
LinearRegressionс параметрами по умолчанию. - Вычислите предсказания на тестовой выборке.
- Рассчитайте RMSE. Функция
mean_squared_error()принимает два аргумента:y_test, а затем предсказания.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))