समूहित सारांश
तो twitter_data में शिकायतों की तुलना में गैर-शिकायतें अधिक हैं। आप शायद सोच रहे होंगे कि क्या यह डेटा सच में Twitter से है! twitter_data में कुछ और दिलचस्प कॉलम हैं जिन्हें ट्वीट्स पर जाने से पहले देखना उपयोगी रहेगा। हर ट्वीट में उस यूज़र के फ़ॉलोअर्स की संख्या usr_followers_count कॉलम में होती है। क्या आप उम्मीद करते हैं कि शिकायत करने वालों के औसतन ज़्यादा यूज़र होंगे या कम, उन लोगों की तुलना में जो शिकायत नहीं करते? आप समूहित सारांशों का उपयोग करके इसका उत्तर जल्दी और आसानी से निकाल सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Text Analysis परिचय
अभ्यास निर्देश
- डेटा को
complaint_labelके आधार पर समूहित करें. usr_followers_countकी औसत, न्यूनतम, और अधिकतम संख्या निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Start with the data frame
___ %>%
# Group the data by whether or not the tweet is a complaint
___(___) %>%
# Compute the mean, min, and max follower counts
summarize(
avg_followers = ___(___),
min_followers = ___(___),
max_followers = ___(___)
)