Förutsägelse av filmintäkter med CatBoost
Nu avslutar vi kapitlet om boosting med att återvända till datamängden movies! I den här övningen bygger du en CatBoostRegressor för att förutsäga log-intäkterna. Kom ihåg att vår bästa modell hittills är AdaBoost-modellen med ett RMSE på 5.15.
Klår CatBoost AdaBoost? Vi försöker använda en liknande uppsättning parametrar för en rättvis jämförelse.
Kom ihåg att de särdrag vi har använt hittills är: 'budget', 'popularity', 'runtime', 'vote_average' och 'vote_count'. catboost har importerats åt dig som cb.
OBS: var noga med att inte använda en klassificerare – annars kan din session ta slut!
Den här övningen är en del av kursen
Ensemblemetoder i Python
Övningsinstruktioner
- Bygg och träna en
CatBoostRegressormed100estimatorer, en inlärningshastighet på0.1och ett maximalt djup på3. - Beräkna prediktionerna för testmängden och skriv ut RMSE-värdet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
import catboost as cb
# Build and fit a CatBoost regressor
reg_cat = ____.____(____, ____, ____, random_state=500)
____
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance using the RMSE
rmse_cat = np.sqrt(mean_squared_error(y_test, pred))
print('RMSE (CatBoost): {:.3f}'.format(rmse_cat))