EDA-diagram I
Nu när du har tagit fram några grundläggande statistikmått är det dags att formulera och validera hypoteser om samband i datan. DataFrame:en train från taxitävlingen finns redan tillgänglig i din arbetsyta.
Låt oss börja med ett spridningsdiagram som visar sambandet mellan taxipriset och resans längd. Intuitivt borde längre resor kosta mer.
För att beräkna avståndet i kilometer mellan två geografiska koordinater används haversinavståndet. Det finns tillgängligt via funktionen haversine_distance(), som redan är definierad åt dig. Funktionen tar DataFrame:en train som indata.
Den här övningen är en del av kursen
Vinna en Kaggle-tävling i Python
Övningsinstruktioner
- Skapa en ny variabel "distance_km" som haversinavståndet mellan upphämtnings- och avlämningsplatsen.
- Rita ett spridningsdiagram med "fare_amount" på x-axeln och "distance_km" på y-axeln. Använd matplotlib-metoden
scatter()för att rita diagrammet. - Begränsa resavståndet till mellan 0 och 50 kilometer för att undvika att extremvärden påverkar diagrammet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Calculate the ride distance
train['distance_km'] = ____(train)
# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')
# Limit on the distance
plt.ylim(0, ____)
plt.show()