ПочатиПочніть безкоштовно

Об'єднання рівнів

Якщо з перекошеним розподілом exclaim_mess було складно працювати, то кількість зображень, прикріплених до кожного листа (image), створює ще більше викликів. Запустіть у консолі код нижче, щоб оцінити його розподіл:

table(email$image)

Пам'ятайте, що це підраховує кількість спостережень у кожній категорії (наприклад, 3811 листів із 0 зображеннями). Враховуючи дуже малі підрахунки для більших значень кількості зображень, давайте згорнемо image до категоріальної змінної, яка показує, чи мав лист принаймні одне зображення. У цій вправі ви створите цю нову змінну та дослідите її зв'язок із спамом.

Ця вправа є частиною курсу

Розвідувальний аналіз даних у R

Переглянути курс

Інструкції до вправи

Починаючи з email, побудуйте безперервний ланцюжок, що поєднує такі кроки:

  • Створіть нову змінну has_image, яка дорівнює TRUE, якщо кількість зображень більша за нуль, і FALSE інакше.
  • Створіть відповідний графік із email, щоб візуалізувати зв'язок між has_image і spam.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create plot of proportion of spam by image
email %>%
  mutate(has_image = ___) %>%
  ggplot(aes(x = ___, fill = ___)) +
  geom_bar(position = ___)
Редагувати та запускати код