Zincirlerle soruları yanıtlama
Belirli bir veri kümesi hakkında net bir sorunun olduğunda, uygun R kodu zincirini dikkatlice kurarak yanıtına ulaşabilirsin. Örneğin şu soruyu düşün: "Spam olmayan e-postalarda, birden fazla kişiye gönderilenlerin tipik e-posta uzunluğu daha mı kısadır?"
Bu, aşağıdaki zincirle yanıtlanabilir:
email %>%
filter(spam == "not-spam") %>%
group_by(to_multiple) %>%
summarize(median(num_char))
Bu kod, bir e-postanın uzunluğunu ölçmek için num_char'ı ve tipik olanı ölçmek için median()'i kullandığını açıkça gösterir. Bu kodu çalıştırırsan, sorunun yanıtının "evet" olduğunu görürsün: birden fazla kişiye gönderilen spam olmayan e-postaların tipik uzunluğu, yalnızca bir kişiye gönderilenlerden biraz daha düşüktür.
Bu zincir özet istatistiklerle sonuçlandı, ancak diğerleri bir grafikle bitebilir; bu, yanıtlamaya çalıştığın soruya bağlıdır.
Bu egzersiz, kursun bir parçasıdır
R ile Keşifsel Veri Analizi
Egzersiz talimatları
Her ikisi de dollar değişkeniyle ilgili olacak şekilde, aşağıdaki soruların her birini yanıtlayacak bir zincir oluştur.
- "dollar" kelimesini içeren e-postalar için, tipik bir spam e-posta bu kelimenin tipik bir spam olmayan e-postadan daha fazla geçişini mi içerir? Bu soruyu yanıtlayan bir özet istatistik oluştur.
- Eğer
dollarkelimesi 10'dan fazla kez geçen bir e-posta ile karşılaşırsan, bunun spam olma olasılığı mı yoksa not-spam olma olasılığı mı daha yüksektir? Bu soruyu yanıtlayan bir çubuk grafik oluştur.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Question 1
email %>%
filter(___) %>%
group_by(___) %>%
summarize(___)
# Question 2
email %>%
filter(___) %>%
ggplot(aes(x = ___)) +
geom_bar()