Від гістограми до KDE
У цій вправі ми розглядаємо підмножину наших даних про постанови, виписані для "Heavy Duty Truck". Уявімо, що ви — обізнаний із даними водій вантажівки й хочете з'ясувати, коли найнебезпечніше виїжджати на дорогу. Зверніть увагу, що розмір вибірки тут лише 32 спостереження.
Нижче наведено код для побудови стандартної гістограми за допомогою ggplot. Не дивно, що вона не дуже вдала. Даних замало, щоб заповнити навіть 30 інтервалів, тож графік важко читати й складно зрозуміти розподіл. Замініть геометрію на KDE за допомогою geom_density(). Нарешті, щоб зберегти максимальну прозорість візуалізації, додайте до графіка підзаголовок, який повідомляє глядачеві про ширину вікна, використану для вашого KDE.
Ця вправа є частиною курсу
Найкращі практики візуалізації в R
Інструкції до вправи
- Змініть геометрію гістограми на щільність (
geom_density()). - Змініть типову ширину вікна на
1.5одиниці. - Додайте до графіка
subtitle"Gaussian kernel SD = 1.5", щоб поінформувати читача про ширину вікна вашого ядра.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>%
filter(vehicle_type == "Heavy Duty Truck")
ggplot(truck_speeding, aes(x = hour_of_day)) +
# switch to density with bin width of 1.5, keep fill
geom_histogram(fill = 'steelblue') +
# add a subtitle stating binwidth
labs(title = 'Citations by hour')