Прогнозування касових зборів фільмів
Почнімо завдання з прогнозування касових зборів, побудувавши просту лінійну регресію для оцінювання логарифма виручки фільмів на основі ознаки 'budget'. Метрика, яку ви тут використаєте, — RMSE (корінь із середньоквадратичної помилки). Щоб обчислити це за допомогою scikit-learn, скористайтеся функцією mean_squared_error() з модуля sklearn.metrics, а потім візьміть квадратний корінь результату за допомогою numpy.
Набір даних movies уже завантажено та розділено на тренувальну й тестову вибірки. Крім того, пропущені значення замінено на нулі. Ми також стандартизували вхідну ознаку за допомогою StandardScaler(). Перегляньте курси DataCamp про очищення даних і інженерію ознак, якщо хочете дізнатися більше про передоброблення для машинного навчання.
Ця вправа є частиною курсу
Ансамблеві методи в Python
Інструкції до вправи
- Створіть екземпляр стандартної моделі
LinearRegression. - Обчисліть прогнози на тестовій вибірці.
- Обчисліть RMSE. Функція
mean_squared_error()приймає два аргументи: спочаткуy_test, а потім прогнози.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))