Kom igångKom igång gratis

Baslinje baserad på gradient boosting

Nu ska du bygga en sista baslinje med Random Forest. I videon såg du en stor förbättring av resultatet när vi gick från grupperingsbaslinjen till Gradient Boosting. Här använder du sklearn:s Random Forest för att förbättra resultatet ytterligare.

Målet med den här övningen är att ta numeriska särdrag och träna en Random Forest-modell utan någon finjustering. Därefter kan du göra prediktioner på testdata och validera resultatet i Public Leaderboard. Observera att du redan har ett särdrag, "hour", som också kan användas som indata till modellen.

Den här övningen är en del av kursen

Vinna en Kaggle-tävling i Python

Visa kurs

Övningsinstruktioner

  • Lägg till särdragret "hour" i listan med numeriska särdrag.
  • Träna RandomForestRegressor på träningsdata med numeriska särdrag och "fare_amount" som målvariabel.
  • Använd den tränade Random Forest-modellen för att göra prediktioner på testdata.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from sklearn.ensemble import RandomForestRegressor

# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
            'dropoff_latitude', 'passenger_count', ____]

# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)

# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])

# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)
Redigera och kör kod