กราฟ EDA ชุดที่ 1
หลังจากสร้างสถิติเบื้องต้นไปแล้ว ถึงเวลาตั้งสมมติฐานและทดสอบความสัมพันธ์ในข้อมูล DataFrame train จากการแข่งขัน taxi พร้อมใช้งานในพื้นที่ทำงานของคุณแล้ว
เริ่มต้นด้วยการสร้าง scatterplot เพื่อดูความสัมพันธ์ระหว่างค่าโดยสารและระยะทางของการเดินทาง โดยทั่วไปแล้ว ยิ่งเดินทางไกล ค่าโดยสารก็ยิ่งสูงขึ้น
สำหรับการคำนวณระยะทางระหว่างพิกัดภูมิศาสตร์สองจุดในหน่วยกิโลเมตร จะใช้ Haversine distance ซึ่งมีฟังก์ชัน haversine_distance() กำหนดไว้ให้แล้ว โดยฟังก์ชันนี้รับ DataFrame train เป็น input
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การแข่งขัน Kaggle ด้วย Python
คำแนะนำการฝึกหัด
- สร้างตัวแปรใหม่ชื่อ "distance_km" โดยคำนวณ Haversine distance ระหว่างจุดรับและจุดส่งผู้โดยสาร
- สร้าง scatterplot โดยให้แกน x แสดง "fare_amount" และแกน y แสดง "distance_km" โดยใช้เมธอด
scatter()ของ matplotlib - กำหนดช่วงระยะทางให้อยู่ระหว่าง 0 ถึง 50 กิโลเมตร เพื่อหลีกเลี่ยงการแสดง outlier
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Calculate the ride distance
train['distance_km'] = ____(train)
# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')
# Limit on the distance
plt.ylim(0, ____)
plt.show()