लेवल्स को समेटना
exclaim_mess के भारी skew के साथ काम करना कठिन था तो, प्रति ईमेल जुड़ी छवियों की संख्या (image) और भी बड़ी चुनौती पेश करती है. इसकी distribution का अंदाज़ा लगाने के लिए कंसोल में यह कोड चलाइए:
table(email$image)
ध्यान दें कि यह प्रत्येक श्रेणी में मामलों की संख्या बताता है (जैसे 0 images वाली 3811 emails थीं). चूँकि अधिक images की संख्या पर काउंट बहुत कम हैं, आइए image को एक श्रेणीबद्ध वैरिएबल में समेटते हैं जो बताए कि ईमेल में कम से कम एक image थी या नहीं. इस अभ्यास में, आप यह नया वैरिएबल बनाएँगे और spam के साथ उसके संबंध को एक्सप्लोर करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Exploratory Data Analysis
अभ्यास निर्देश
email से शुरू करते हुए, एक निरंतर चेन बनाइए जो निम्न कार्यों को जोड़ती है:
has_imageनाम का नया वैरिएबल बनाएँ, जो वहाँTRUEहो जहाँ images की संख्या शून्य से अधिक हो, अन्यथाFALSE.emailके साथ एक उपयुक्त प्लॉट बनाएँ ताकिhas_imageऔरspamके बीच संबंध को विज़ुअलाइज़ किया जा सके.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)