शुरू करेंमुफ़्त में शुरू करें

चेन के साथ प्रश्नों के उत्तर

जब आपके पास किसी डेटासेट के बारे में कोई विशेष प्रश्न हो, तो आप उपयुक्त R कोड की चेन बनाकर सावधानी से उसके उत्तर तक पहुँच सकते हैं। उदाहरण के लिए, यह प्रश्न देखें: "नॉन‑स्पैम ईमेल्स में, क्या कई लोगों को भेजे गए ईमेल्स की सामान्य लंबाई कम होती है?"

इसका उत्तर नीचे दी गई चेन से मिल सकता है:

email %>%
   filter(spam == "not-spam") %>%
   group_by(to_multiple) %>%
   summarize(median(num_char))

यह कोड साफ बताता है कि आप ईमेल की लंबाई मापने के लिए num_char का और "सामान्य" का मानक बताने के लिए median() का उपयोग कर रहे हैं। यदि आप यह कोड चलाएँगे, तो पता चलेगा कि उत्तर "हाँ" है: कई लोगों को भेजे गए नॉन‑स्पैम ईमेल्स की सामान्य लंबाई, केवल एक व्यक्ति को भेजे गए ईमेल्स की तुलना में थोड़ी कम है।

यह चेन summary statistics पर खत्म होती है, लेकिन अन्य चेन किसी plot पर भी समाप्त हो सकती हैं; यह पूरी तरह उस प्रश्न पर निर्भर करता है जिसका आप उत्तर देना चाह रहे हैं।

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Exploratory Data Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

dollar वैरिएबल से जुड़े निम्न दोनों प्रश्नों का उत्तर देने के लिए एक-एक चेन बनाएँ।

  • जिन ईमेल्स में "dollar" शब्द आता है, क्या सामान्य स्पैम ईमेल में इस शब्द की आवृत्ति सामान्य नॉन‑स्पैम ईमेल से अधिक होती है? इस प्रश्न का उत्तर देने वाला एक summary statistic बनाएँ।
  • यदि आपको ऐसा ईमेल मिले जिसमें dollar शब्द 10 से अधिक बार आता है, तो उसके स्पैम होने की संभावना अधिक है या not-spam? इस प्रश्न का उत्तर देने वाला एक bar chart बनाएँ।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Question 1
email %>%
  filter(___) %>%
  group_by(___) %>%
  summarize(___)

# Question 2
email %>%
  filter(___) %>%
  ggplot(aes(x = ___)) +
  geom_bar()
कोड संपादित करें और चलाएँ