शुरू करेंमुफ़्त में शुरू करें

Proportion के आधार पर वैरिएबल्स को lump करना

कई बार आपके पास ऐसे विशेष लेवल नहीं होते जिन्हें आप किसी और में बदलना या साथ में मिला देना चाहते हैं. बल्कि, आप सबसे सामान्य लेवल्स को रखना चाहते हैं और बाकी सबको "other" में डालना चाहते हैं. खासकर जब लेवल बहुत ज़्यादा हों और अधिकतर दुर्लभ हों, तो यह डेटा दिखाने के लिए उपयोगी होता है. आइए इसे Kaggle सर्वे के उस प्रश्न के साथ आज़माएँ जिसमें पूछा गया था कि लोग अगले साल कौन-सी मशीन लर्निंग मेथड्स आज़माना चाहते हैं. multiple_choice_responses आपके लिए लोड कर दिया गया है. काउंट करते समय याद रखें कि sort = TRUE डिफ़ॉल्ट रूप से descending क्रम से मेल खाता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Tidyverse में Categorical डेटा

पाठ्यक्रम देखें

अभ्यास निर्देश

  • जिन लोगों ने कोई मेथड नहीं चुना, उन्हें हटा दें.
  • MLMethodNextYearSelect से एक नया वैरिएबल ml_method बनाएँ, जिसमें कम-से-कम 5% उत्तरदाताओं द्वारा चुने गए टाइटल्स सुरक्षित रहें और बाकी को "Other" (डिफ़ॉल्ट वैल्यू) के रूप में lump कर दें.
  • अंत में, अपने नए वैरिएबल को descending क्रम में sort करके count करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

multiple_choice_responses %>%
  # Remove NAs of MLMethodNextYearSelect
  filter(___) %>%
  # Create ml_method, which lumps all those with less than 5% of people into "Other"
  mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
  # Count the frequency of your new variable, sorted in descending order
  ___(___, ___)
कोड संपादित करें और चलाएँ