शुरू करेंमुफ़्त में शुरू करें

जेंडर डेटा को एक्सप्लोर करें

gender डेटा में 10,000 लोगों के Weight, Height और BMI इंडेक्स हैं. मूल डेटा में Gender लेबल हैं: 5,000 लोग खुद को महिला और बाकी 5,000 पुरुष बताते हैं. ये लेबल बाद में यह जाँचने के लिए उपयोगी होंगे कि क्लस्टरिंग वास्तविक लेबल्स की तुलना में कितनी अच्छी है. हालांकि, इस डेटासेट के इस सबसेट में लेबल दिए नहीं गए हैं.

gender_with_probs डेटा में हर डेटा पॉइंट के किसी क्लस्टर से संबंधित होने की probabilities भी हैं. हम दो क्लस्टर्स में रुचि रखते हैं, इसलिए 1 के क़रीब probabilities एक क्लस्टर को दर्शाती हैं और 0 के क़रीब दूसरी को.

इस अभ्यास का उद्देश्य क्लस्टरिंग से पहले और बाद में एक सामान्य क्लस्टरिंग डेटासेट कैसा दिखता है, इसकी एक झलक लेना है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Mixture Models

पाठ्यक्रम देखें

अभ्यास निर्देश

  • head फंक्शन का उपयोग करके gender की पहली 6 observations देखें.
  • head फंक्शन का उपयोग करके gender_with_probs की पहली 6 observations देखें.
  • एक scatterplot बनाएँ जिसमें x-axis पर Weight और y-axis पर BMI हो. डॉट्स का रंग उनकी probability के अनुसार रखें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
कोड संपादित करें और चलाएँ