Kom igångKom igång gratis

EDA-diagram I

Nu när du har tagit fram några grundläggande statistikmått är det dags att formulera och validera hypoteser om samband i datan. DataFrame:en train från taxitävlingen finns redan tillgänglig i din arbetsyta.

Låt oss börja med ett spridningsdiagram som visar sambandet mellan taxipriset och resans längd. Intuitivt borde längre resor kosta mer.

För att beräkna avståndet i kilometer mellan två geografiska koordinater används haversinavståndet. Det finns tillgängligt via funktionen haversine_distance(), som redan är definierad åt dig. Funktionen tar DataFrame:en train som indata.

Den här övningen är en del av kursen

Vinna en Kaggle-tävling i Python

Visa kurs

Övningsinstruktioner

  • Skapa en ny variabel "distance_km" som haversinavståndet mellan upphämtnings- och avlämningsplatsen.
  • Rita ett spridningsdiagram med "fare_amount" på x-axeln och "distance_km" på y-axeln. Använd matplotlib-metoden scatter() för att rita diagrammet.
  • Begränsa resavståndet till mellan 0 och 50 kilometer för att undvika att extremvärden påverkar diagrammet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Calculate the ride distance
train['distance_km'] = ____(train)

# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')

# Limit on the distance
plt.ylim(0, ____)
plt.show()
Redigera och kör kod