Proportion के आधार पर वैरिएबल्स को lump करना
कई बार आपके पास ऐसे विशेष लेवल नहीं होते जिन्हें आप किसी और में बदलना या साथ में मिला देना चाहते हैं. बल्कि, आप सबसे सामान्य लेवल्स को रखना चाहते हैं और बाकी सबको "other" में डालना चाहते हैं. खासकर जब लेवल बहुत ज़्यादा हों और अधिकतर दुर्लभ हों, तो यह डेटा दिखाने के लिए उपयोगी होता है. आइए इसे Kaggle सर्वे के उस प्रश्न के साथ आज़माएँ जिसमें पूछा गया था कि लोग अगले साल कौन-सी मशीन लर्निंग मेथड्स आज़माना चाहते हैं. multiple_choice_responses आपके लिए लोड कर दिया गया है. काउंट करते समय याद रखें कि sort = TRUE डिफ़ॉल्ट रूप से descending क्रम से मेल खाता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Tidyverse में Categorical डेटा
अभ्यास निर्देश
- जिन लोगों ने कोई मेथड नहीं चुना, उन्हें हटा दें.
MLMethodNextYearSelectसे एक नया वैरिएबलml_methodबनाएँ, जिसमें कम-से-कम 5% उत्तरदाताओं द्वारा चुने गए टाइटल्स सुरक्षित रहें और बाकी को "Other" (डिफ़ॉल्ट वैल्यू) के रूप में lump कर दें.- अंत में, अपने नए वैरिएबल को descending क्रम में sort करके count करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
multiple_choice_responses %>%
# Remove NAs of MLMethodNextYearSelect
filter(___) %>%
# Create ml_method, which lumps all those with less than 5% of people into "Other"
mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
# Count the frequency of your new variable, sorted in descending order
___(___, ___)