Ответы на вопросы с помощью цепочек
Когда у вас есть конкретный вопрос о наборе данных, найти ответ можно, грамотно выстроив нужную цепочку R-кода. Рассмотрим, например, такой вопрос: «Среди писем, не являющихся спамом, короче ли обычно те, что были отправлены нескольким адресатам?»
Ответить на него поможет следующая цепочка:
email %>%
filter(spam == "not-spam") %>%
group_by(to_multiple) %>%
summarize(median(num_char))
Код наглядно показывает, что для измерения длины письма используется переменная num_char, а в качестве типичного значения — median(). Если вы запустите этот код, то узнаете, что ответ на вопрос — «да»: типичная длина писем не-спама, отправленных нескольким людям, несколько меньше, чем у писем, адресованных одному получателю.
Эта цепочка завершилась сводной статистикой, однако другие цепочки могут заканчиваться графиком — всё зависит от того, на какой вопрос вы ищете ответ.
Это упражнение является частью курса
Разведочный анализ данных в R
Инструкции к упражнению
Постройте цепочку для ответа на каждый из приведённых ниже вопросов — оба касаются переменной dollar.
- Для писем, содержащих слово «dollar»: встречается ли это слово чаще в типичном письме-спаме, чем в типичном письме не-спаме? Вычислите сводную статистику, которая ответит на этот вопрос.
- Если в письме слово
dollarвстречается более 10 раз, скорее всего, это спам или нет? Постройте столбчатую диаграмму, которая ответит на этот вопрос.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Question 1
email %>%
filter(___) %>%
group_by(___) %>%
summarize(___)
# Question 2
email %>%
filter(___) %>%
ggplot(aes(x = ___)) +
geom_bar()