Графики разведочного анализа данных I
После вычисления базовой статистики пришло время выдвинуть и проверить некоторые гипотезы о зависимостях в данных. Набор данных train из соревнования по прогнозированию стоимости поездки на такси уже доступен в вашем рабочем пространстве.
Для начала построим диаграмму рассеяния, которая покажет зависимость между стоимостью поездки и её расстоянием. Логично предположить, что чем длиннее поездка, тем она дороже.
Для вычисления расстояния в километрах между двумя географическими координатами используйте расстояние Хаверсина. Его расчёт реализован в функции haversine_distance(), которая уже определена для вас. Функция принимает на вход набор данных train.
Это упражнение является частью курса
Победа в соревновании Kaggle на Python
Инструкции к упражнению
- Создайте новую переменную «distance_km» как расстояние Хаверсина между точками посадки и высадки.
- Постройте диаграмму рассеяния, отложив «fare_amount» по оси x, а «distance_km» — по оси y. Для построения диаграммы используйте метод
scatter()из matplotlib. - Ограничьте диапазон расстояний поездки от 0 до 50 километров, чтобы исключить выбросы из графика.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate the ride distance
train['distance_km'] = ____(train)
# Draw a scatterplot
plt.____(x=____[____], y=____[____], alpha=0.5)
plt.xlabel('Fare amount')
plt.ylabel('Distance, km')
plt.title('Fare amount based on the distance')
# Limit on the distance
plt.ylim(0, ____)
plt.show()