जेंडर डेटा को एक्सप्लोर करें
gender डेटा में 10,000 लोगों के Weight, Height और BMI इंडेक्स हैं. मूल डेटा में Gender लेबल हैं: 5,000 लोग खुद को महिला और बाकी 5,000 पुरुष बताते हैं. ये लेबल बाद में यह जाँचने के लिए उपयोगी होंगे कि क्लस्टरिंग वास्तविक लेबल्स की तुलना में कितनी अच्छी है. हालांकि, इस डेटासेट के इस सबसेट में लेबल दिए नहीं गए हैं.
gender_with_probs डेटा में हर डेटा पॉइंट के किसी क्लस्टर से संबंधित होने की probabilities भी हैं. हम दो क्लस्टर्स में रुचि रखते हैं, इसलिए 1 के क़रीब probabilities एक क्लस्टर को दर्शाती हैं और 0 के क़रीब दूसरी को.
इस अभ्यास का उद्देश्य क्लस्टरिंग से पहले और बाद में एक सामान्य क्लस्टरिंग डेटासेट कैसा दिखता है, इसकी एक झलक लेना है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Mixture Models
अभ्यास निर्देश
headफंक्शन का उपयोग करकेgenderकी पहली 6 observations देखें.headफंक्शन का उपयोग करकेgender_with_probsकी पहली 6 observations देखें.- एक scatterplot बनाएँ जिसमें x-axis पर
Weightऔर y-axis परBMIहो. डॉट्स का रंग उनकी probability के अनुसार रखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)