ÎncepețiÎncepe gratuit

Linie de bază bazată pe gradient boosting

Hai să construim o linie de bază finală folosind Random Forest. Ai văzut o îmbunătățire semnificativă a scorului în video, trecând de la linia de bază cu grupare la Gradient Boosting. Acum vei folosi Random Forest din sklearn pentru a îmbunătăți și mai mult acest scor.

Scopul acestui exercițiu este să folosești caracteristicile numerice și să antrenezi un model Random Forest fără nicio ajustare a hiperparametrilor. Apoi poți genera predicții pe setul de testare și valida rezultatul pe clasamentul public. Reține că ai deja o caracteristică "hour" care poate fi folosită și ea ca intrare în model.

Acest exercițiu face parte din cursul

Câștigarea unei competiții Kaggle în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Adaugă caracteristica "hour" la lista de caracteristici numerice.
  • Antrenează RandomForestRegressor pe datele de antrenament, folosind caracteristicile numerice și "fare_amount" ca variabilă țintă.
  • Folosește modelul Random Forest antrenat pentru a genera predicții pe datele de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.ensemble import RandomForestRegressor

# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
            'dropoff_latitude', 'passenger_count', ____]

# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)

# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])

# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)
Editează și rulează codul