Baslinje baserad på gradient boosting
Nu ska du bygga en sista baslinje med Random Forest. I videon såg du en stor förbättring av resultatet när vi gick från grupperingsbaslinjen till Gradient Boosting. Här använder du sklearn:s Random Forest för att förbättra resultatet ytterligare.
Målet med den här övningen är att ta numeriska särdrag och träna en Random Forest-modell utan någon finjustering. Därefter kan du göra prediktioner på testdata och validera resultatet i Public Leaderboard. Observera att du redan har ett särdrag, "hour", som också kan användas som indata till modellen.
Den här övningen är en del av kursen
Vinna en Kaggle-tävling i Python
Övningsinstruktioner
- Lägg till särdragret
"hour"i listan med numeriska särdrag. - Träna
RandomForestRegressorpå träningsdata med numeriska särdrag och"fare_amount"som målvariabel. - Använd den tränade Random Forest-modellen för att göra prediktioner på testdata.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)