शुरू करेंमुफ़्त में शुरू करें

लेवल्स को समेटना

exclaim_mess के भारी skew के साथ काम करना कठिन था तो, प्रति ईमेल जुड़ी छवियों की संख्या (image) और भी बड़ी चुनौती पेश करती है. इसकी distribution का अंदाज़ा लगाने के लिए कंसोल में यह कोड चलाइए:

table(email$image)

ध्यान दें कि यह प्रत्येक श्रेणी में मामलों की संख्या बताता है (जैसे 0 images वाली 3811 emails थीं). चूँकि अधिक images की संख्या पर काउंट बहुत कम हैं, आइए image को एक श्रेणीबद्ध वैरिएबल में समेटते हैं जो बताए कि ईमेल में कम से कम एक image थी या नहीं. इस अभ्यास में, आप यह नया वैरिएबल बनाएँगे और spam के साथ उसके संबंध को एक्सप्लोर करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Exploratory Data Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

email से शुरू करते हुए, एक निरंतर चेन बनाइए जो निम्न कार्यों को जोड़ती है:

  • has_image नाम का नया वैरिएबल बनाएँ, जो वहाँ TRUE हो जहाँ images की संख्या शून्य से अधिक हो, अन्यथा FALSE.
  • email के साथ एक उपयुक्त प्लॉट बनाएँ ताकि has_image और spam के बीच संबंध को विज़ुअलाइज़ किया जा सके.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create plot of proportion of spam by image
email %>%
  mutate(has_image = ___) %>%
  ggplot(aes(x = ___, fill = ___)) +
  geom_bar(position = ___)
कोड संपादित करें और चलाएँ