Graphiques d'EDA I
Après avoir généré quelques statistiques de base, il est temps de proposer et de valider des idées sur les dépendances entre les données. Encore une fois, le DataFrame train de la compétition de taxi est déjà disponible dans votre espace de travail.
Pour commencer, créons un nuage de points qui représente la relation entre le montant de la course et la distance parcourue. Intuitivement, plus la course est longue, plus son prix est élevé.
Pour obtenir la distance en kilomètres entre deux géocoordonnées, vous allez utiliser la distance de Haversine. Son calcul est disponible via la fonction haversine_distance() qui a été définie pour vous. La fonction attend le DataFrame train en entrée.
Cette activité fait partie du cours
Remporter une compétition Kaggle en Python
Instructions de l’exercice
- Créez une nouvelle variable « distance_km » correspondant à la distance de Haversine entre les points d'embarquement et de débarquement.
- Tracez un nuage de points avec « fare_amount » sur l'axe des x et « distance_km » sur l'axe des y. Pour tracer un nuage de points, utilisez la méthode
scatter()de matplotlib. - Limitez la distance d'une course entre 0 et 50 kilomètres afin d'éviter de représenter les valeurs aberrantes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Calculate the ride distance
train['distance_km'] = ____(train)
# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')
# Limit on the distance
plt.ylim(0, ____)
plt.show()