Відповідаємо на запитання за допомогою ланцюжків
Коли у вас є конкретне запитання про набір даних, ви можете дійти відповіді, уважно склавши відповідний ланцюжок коду R. Наприклад, розгляньмо таке запитання: «Серед не-спаму, чи є типова довжина листів меншою для тих, що були надіслані кільком адресатам?»
На нього можна відповісти за допомогою такого ланцюжка:
email %>%
filter(spam == "not-spam") %>%
group_by(to_multiple) %>%
summarize(median(num_char))
Із коду зрозуміло, що ви використовуєте num_char для вимірювання довжини листа, а median() — як міру «типового» значення. Якщо запустити цей код, ви дізнаєтеся, що відповідь на запитання — «так»: типова довжина не-спам листів, надісланих кільком людям, трохи менша, ніж у тих, що надіслані лише одній особі.
Цей ланцюжок завершується підсумковою статистикою, але інші можуть завершуватися графіком — усе залежить від запитання, на яке ви намагаєтеся відповісти.
Ця вправа є частиною курсу
Розвідувальний аналіз даних у R
Інструкції до вправи
Побудуйте ланцюжок, щоб відповісти на кожне з наведених запитань щодо змінної dollar.
- Для листів, що містять слово «dollar», чи має типовий спам-блист більше входжень цього слова, ніж типовий не-спам лист? Створіть підсумкову статистику, яка відповідає на це запитання.
- Якщо ви зустрічаєте лист із понад 10 входженнями слова
dollar, чи більш імовірно, що це спам, чи не-спам? Створіть стовпчикову діаграму, яка відповідає на це запитання.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Question 1
email %>%
filter(___) %>%
group_by(___) %>%
summarize(___)
# Question 2
email %>%
filter(___) %>%
ggplot(aes(x = ___)) +
geom_bar()