Об'єднання рівнів
Якщо з перекошеним розподілом exclaim_mess було складно працювати, то кількість зображень, прикріплених до кожного листа (image), створює ще більше викликів. Запустіть у консолі код нижче, щоб оцінити його розподіл:
table(email$image)
Пам'ятайте, що це підраховує кількість спостережень у кожній категорії (наприклад, 3811 листів із 0 зображеннями). Враховуючи дуже малі підрахунки для більших значень кількості зображень, давайте згорнемо image до категоріальної змінної, яка показує, чи мав лист принаймні одне зображення. У цій вправі ви створите цю нову змінну та дослідите її зв'язок із спамом.
Ця вправа є частиною курсу
Розвідувальний аналіз даних у R
Інструкції до вправи
Починаючи з email, побудуйте безперервний ланцюжок, що поєднує такі кроки:
- Створіть нову змінну
has_image, яка дорівнюєTRUE, якщо кількість зображень більша за нуль, іFALSEінакше. - Створіть відповідний графік із
email, щоб візуалізувати зв'язок міжhas_imageіspam.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)