ПочатиПочніть безкоштовно

Відповідаємо на запитання за допомогою ланцюжків

Коли у вас є конкретне запитання про набір даних, ви можете дійти відповіді, уважно склавши відповідний ланцюжок коду R. Наприклад, розгляньмо таке запитання: «Серед не-спаму, чи є типова довжина листів меншою для тих, що були надіслані кільком адресатам?»

На нього можна відповісти за допомогою такого ланцюжка:

email %>%
   filter(spam == "not-spam") %>%
   group_by(to_multiple) %>%
   summarize(median(num_char))

Із коду зрозуміло, що ви використовуєте num_char для вимірювання довжини листа, а median() — як міру «типового» значення. Якщо запустити цей код, ви дізнаєтеся, що відповідь на запитання — «так»: типова довжина не-спам листів, надісланих кільком людям, трохи менша, ніж у тих, що надіслані лише одній особі.

Цей ланцюжок завершується підсумковою статистикою, але інші можуть завершуватися графіком — усе залежить від запитання, на яке ви намагаєтеся відповісти.

Ця вправа є частиною курсу

Розвідувальний аналіз даних у R

Переглянути курс

Інструкції до вправи

Побудуйте ланцюжок, щоб відповісти на кожне з наведених запитань щодо змінної dollar.

  • Для листів, що містять слово «dollar», чи має типовий спам-блист більше входжень цього слова, ніж типовий не-спам лист? Створіть підсумкову статистику, яка відповідає на це запитання.
  • Якщо ви зустрічаєте лист із понад 10 входженнями слова dollar, чи більш імовірно, що це спам, чи не-спам? Створіть стовпчикову діаграму, яка відповідає на це запитання.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Question 1
email %>%
  filter(___) %>%
  group_by(___) %>%
  summarize(___)

# Question 2
email %>%
  filter(___) %>%
  ggplot(aes(x = ___)) +
  geom_bar()
Редагувати та запускати код