Modèle de base fondé sur la date
Nous avons déjà bâti 3 modèles de base différents. Pour vous exercer davantage, créons-en quelques autres. Le premier modèle repose sur des variables de regroupement. Il est clair que le tarif d'une course peut dépendre du moment de la journée. Par exemple, les prix peuvent être plus élevés pendant les heures de pointe.
Votre objectif est de construire un modèle de base qui attribue la « fare_amount » moyenne pour l'heure correspondante. Pour l'instant, vous allez créer le modèle sur l'ensemble des données train et produire des prédictions pour l'ensemble test.
Les DataFrames train et test sont disponibles dans votre espace de travail. De plus, la colonne « pickup_datetime » dans les deux DataFrames a déjà été convertie en objet datetime pour vous.
Cette activité fait partie du cours
Remporter une compétition Kaggle en Python
Instructions de l’exercice
- Récupérez l'heure à partir de la colonne « pickup_datetime » pour les DataFrames
trainettest. - Calculez la « fare_amount » moyenne pour chaque heure sur les données d'entraînement.
- Effectuez les prédictions
testen utilisant la méthodemap()depandaset le regroupement obtenu. - Écrivez les prédictions dans un fichier.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)