BaşlayınÜcretsiz başlayın

Zincirlerle soruları yanıtlama

Belirli bir veri kümesi hakkında net bir sorunun olduğunda, uygun R kodu zincirini dikkatlice kurarak yanıtına ulaşabilirsin. Örneğin şu soruyu düşün: "Spam olmayan e-postalarda, birden fazla kişiye gönderilenlerin tipik e-posta uzunluğu daha mı kısadır?"

Bu, aşağıdaki zincirle yanıtlanabilir:

email %>%
   filter(spam == "not-spam") %>%
   group_by(to_multiple) %>%
   summarize(median(num_char))

Bu kod, bir e-postanın uzunluğunu ölçmek için num_char'ı ve tipik olanı ölçmek için median()'i kullandığını açıkça gösterir. Bu kodu çalıştırırsan, sorunun yanıtının "evet" olduğunu görürsün: birden fazla kişiye gönderilen spam olmayan e-postaların tipik uzunluğu, yalnızca bir kişiye gönderilenlerden biraz daha düşüktür.

Bu zincir özet istatistiklerle sonuçlandı, ancak diğerleri bir grafikle bitebilir; bu, yanıtlamaya çalıştığın soruya bağlıdır.

Bu egzersiz, kursun bir parçasıdır

R ile Keşifsel Veri Analizi

Kursa Göz Atın

Egzersiz talimatları

Her ikisi de dollar değişkeniyle ilgili olacak şekilde, aşağıdaki soruların her birini yanıtlayacak bir zincir oluştur.

  • "dollar" kelimesini içeren e-postalar için, tipik bir spam e-posta bu kelimenin tipik bir spam olmayan e-postadan daha fazla geçişini mi içerir? Bu soruyu yanıtlayan bir özet istatistik oluştur.
  • Eğer dollar kelimesi 10'dan fazla kez geçen bir e-posta ile karşılaşırsan, bunun spam olma olasılığı mı yoksa not-spam olma olasılığı mı daha yüksektir? Bu soruyu yanıtlayan bir çubuk grafik oluştur.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Question 1
email %>%
  filter(___) %>%
  group_by(___) %>%
  summarize(___)

# Question 2
email %>%
  filter(___) %>%
  ggplot(aes(x = ___)) +
  geom_bar()
Kodu Düzenle ve Çalıştır