НачатьНачать бесплатно

Графики разведочного анализа данных I

После вычисления базовой статистики пришло время выдвинуть и проверить некоторые гипотезы о зависимостях в данных. Набор данных train из соревнования по прогнозированию стоимости поездки на такси уже доступен в вашем рабочем пространстве.

Для начала построим диаграмму рассеяния, которая покажет зависимость между стоимостью поездки и её расстоянием. Логично предположить, что чем длиннее поездка, тем она дороже.

Для вычисления расстояния в километрах между двумя географическими координатами используйте расстояние Хаверсина. Его расчёт реализован в функции haversine_distance(), которая уже определена для вас. Функция принимает на вход набор данных train.

Это упражнение является частью курса

Победа в соревновании Kaggle на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте новую переменную «distance_km» как расстояние Хаверсина между точками посадки и высадки.
  • Постройте диаграмму рассеяния, отложив «fare_amount» по оси x, а «distance_km» — по оси y. Для построения диаграммы используйте метод scatter() из matplotlib.
  • Ограничьте диапазон расстояний поездки от 0 до 50 километров, чтобы исключить выбросы из графика.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate the ride distance
train['distance_km'] = ____(train)

# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')

# Limit on the distance
plt.ylim(0, ____)
plt.show()
Редактировать и запускать код