Model stacking II
Tady je přehled toho, co jsi dosud v rámci implementace stackingu udělal/a:
- Rozdělil/a jsi trénovací data na dvě části
- Natrénoval/a jsi několik modelů na části 1
- Udělal/a jsi predikce na části 2
- Udělal/a jsi predikce na testovacích datech
Tvým cílem je teď vytvořit model druhé úrovně, který jako vstupní příznaky použije predikce z kroků 3 a 4. Tento model se natrénuje na datech z části 2 a pak pomocí něj můžeš provést finální stackingové predikce na testovacích datech.
DataFramy part_2 a test máš už k dispozici v pracovním prostředí. Predikce z modelů Gradient Boosting a Random Forest jsou v těchto DataFramech uloženy pod názvy "gb_pred" a "rf_pred".
Toto cvičení je součástí kurzu
Jak vyhrát soutěž na Kaggle v Pythonu
Pokyny k cvičení
- Natrénuj model Linear Regression na datech z části 2, přičemž jako příznaky použij predikce modelů Gradient Boosting a Random Forest.
- Pomocí predikcí modelů Gradient Boosting a Random Forest jako příznaků proveď predikce na testovacích datech.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.linear_model import LinearRegression
# Create linear regression model without the intercept
lr = LinearRegression(fit_intercept=False)
# Train 2nd level model on the Part 2 data
lr.____(part_2[['gb_pred', '____']], part_2.fare_amount)
# Make stacking predictions on the test data
test['stacking'] = lr.____(test[['gb_pred', '____']])
# Look at the model coefficients
print(lr.coef_)