Linie de bază bazată pe gradient boosting
Hai să construim o linie de bază finală folosind Random Forest. Ai văzut o îmbunătățire semnificativă a scorului în video, trecând de la linia de bază cu grupare la Gradient Boosting. Acum vei folosi Random Forest din sklearn pentru a îmbunătăți și mai mult acest scor.
Scopul acestui exercițiu este să folosești caracteristicile numerice și să antrenezi un model Random Forest fără nicio ajustare a hiperparametrilor. Apoi poți genera predicții pe setul de testare și valida rezultatul pe clasamentul public. Reține că ai deja o caracteristică "hour" care poate fi folosită și ea ca intrare în model.
Acest exercițiu face parte din cursul
Câștigarea unei competiții Kaggle în Python
Instrucțiuni pentru exercițiu
- Adaugă caracteristica
"hour"la lista de caracteristici numerice. - Antrenează
RandomForestRegressorpe datele de antrenament, folosind caracteristicile numerice și"fare_amount"ca variabilă țintă. - Folosește modelul Random Forest antrenat pentru a genera predicții pe datele de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)