Прогнозування доходів фільмів за допомогою CatBoost
Завершімо цей розділ про бустинг і повернімося до набору даних movies! У цій вправі ви побудуєте CatBoostRegressor для прогнозування лог-доходу. Пам'ятайте, що найкраща модель дотепер — це AdaBoost із RMSE 5.15.
Чи перевершить CatBoost AdaBoost? Для чесного порівняння спробуємо подібний набір параметрів.
Нагадаємо, що дотепер ми використовували такі ознаки: 'budget', 'popularity', 'runtime', 'vote_average' та 'vote_count'. catboost уже імпортовано як cb.
Примітка: уважно стежте, щоб не використати класифікатор, інакше ваша сесія може завершитися!
Ця вправа є частиною курсу
Ансамблеві методи в Python
Інструкції до вправи
- Побудуйте та навчіть
CatBoostRegressor, використовуючи100оцінювачів, швидкість навчання0.1та максимальну глибину3. - Обчисліть прогнози для тестового набору та виведіть RMSE.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
import catboost as cb
# Build and fit a CatBoost regressor
reg_cat = ____.____(____, ____, ____, random_state=500)
____
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse_cat = np.sqrt(mean_squared_error(y_test, pred))
print('RMSE (CatBoost): {:.3f}'.format(rmse_cat))