От гистограммы к KDE
В этих упражнениях мы будем анализировать подмножество данных о штрафах, выданных водителям "Heavy Duty Truck". Представьте, что вы водитель грузовика, хорошо разбирающийся в данных, и хотите выяснить, в какое время на дороге наиболее опасно. Обратите внимание: объём выборки здесь составляет всего 32 наблюдения.
Ниже приведён код для построения гистограммы по умолчанию с помощью ggplot. Как и следовало ожидать, результат не очень впечатляет: данных недостаточно, чтобы заполнить даже 30 интервалов, поэтому график трудно читать и анализировать. Замените тип геометрии на KDE с помощью geom_density(). Наконец, чтобы обеспечить максимальную прозрачность визуализации, добавьте к графику подзаголовок, сообщающий читателю ширину полосы пропускания, использованную для KDE.
Это упражнение является частью курса
Лучшие практики визуализации в R
Инструкции к упражнению
- Замените геометрию гистограммы на геометрию плотности (
geom_density()). - Измените ширину интервала по умолчанию на
1.5единицы. - Добавьте к графику
subtitle"Gaussian kernel SD = 1.5", чтобы сообщить читателю ширину полосы пропускания ядра.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>%
filter(vehicle_type == "Heavy Duty Truck")
ggplot(truck_speeding, aes(x = hour_of_day)) +
# switch to density with bin width of 1.5, keep fill
geom_histogram(fill = 'steelblue') +
# add a subtitle stating binwidth
labs(title = 'Citations by hour')