CommencezCommencez gratuitement

Point de référence avec du gradient boosting

Créons un dernier point de référence avec la Random Forest. Vous avez vu dans la vidéo une forte amélioration du score en passant de l'agrégation de base au Gradient Boosting. Maintenant, vous utiliserez la Random Forest de sklearn pour améliorer encore ce score.

L'objectif de cet exercice est de prendre des variables numériques et d'entraîner un modèle Random Forest sans aucun réglage d'hyperparamètres. Ensuite, vous pourrez produire des prédictions sur l'ensemble de test et valider le résultat sur le Public Leaderboard. Notez que vous avez déjà une variable "hour" qui peut aussi servir d'entrée au modèle.

Cette activité fait partie du cours

Remporter une compétition Kaggle en Python

Voir le cours

Instructions de l’exercice

  • Ajoutez la variable "hour" à la liste des variables numériques.
  • Ajustez le RandomForestRegressor sur les données d'entraînement avec les variables numériques et "fare_amount" comme cible.
  • Utilisez le modèle Random Forest entraîné pour faire des prédictions sur les données de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from sklearn.ensemble import RandomForestRegressor

# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
            'dropoff_latitude', 'passenger_count', ____]

# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)

# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])

# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)
Modifier et exécuter le code