Boosting pro predikci příjmů
Počáteční model dosáhl RMSE přibližně 7.34. Pojďme se podívat, jestli to dokážeme zlepšit pomocí jedné iterace boostingu.
Postavíš další lineární regresi, tentokrát ale jako cílové hodnoty použiješ chyby základního modelu, vypočítané takto:
y_train_error = pred_train - y_train
y_test_error = pred_test - y_test
Pro tento model použiješ místo příznaku 'budget' příznak 'popularity' — doufáme, že odhalí informativnější vzory. Máš ho k dispozici jako X_train_pop a X_test_pop. Stejně jako v předchozím cvičení jsou vstupní příznaky již standardizované.
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Natrénuj lineární regresní model na předchozích chybách s využitím
X_train_popay_train_error. - Vypočítej predikované chyby na testovací sadě
X_test_pop. - Vypočítej RMSE stejně jako v předchozím cvičení, tentokrát pomocí
y_test_errorapred_error.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit a linear regression model to the previous errors
reg_error = LinearRegression()
____
# Calculate the predicted errors on the test set
pred_error = ____
# Evaluate the updated performance
rmse_error = ____
print('RMSE: {:.3f}'.format(rmse_error))