시작하기무료로 시작하기

EDA 시각화 I

기본 통계를 몇 가지 살펴봤으니, 이제 데이터 간 의존성에 대한 아이디어를 세우고 검증해 볼 차례예요. 택시 대회에서 가져온 train DataFrame은 워크스페이스에 이미 준비되어 있습니다.

먼저, 요금(fare amount)과 이동 거리의 관계를 산점도로 그려봅시다. 직관적으로는 이동 거리가 길수록 요금이 높아지겠죠.

두 지리 좌표 간 거리를 킬로미터 단위로 얻기 위해 Haversine 거리를 사용하겠습니다. 계산은 여러분을 위해 정의해 둔 haversine_distance() 함수로 할 수 있어요. 이 함수는 train DataFrame을 입력으로 받습니다.

이 연습은 강의의 일부입니다

Python으로 Kaggle 대회 공략하기

강의 보기

연습 안내

  • 픽업 지점과 드롭오프 지점 사이의 Haversine 거리를 새 변수 "distance_km"으로 생성하세요.
  • x축에 "fare_amount", y축에 "distance_km"을 놓고 산점도를 그리세요. 산점도는 matplotlib의 scatter() 메서드를 사용하세요.
  • 이상치를 피하기 위해 이동 거리의 범위를 0에서 50킬로미터로 제한하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Calculate the ride distance
train['distance_km'] = ____(train)

# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')

# Limit on the distance
plt.ylim(0, ____)
plt.show()
코드 편집 및 실행