สำรวจข้อมูลเพศ
ข้อมูล gender ประกอบด้วย Weight, Height และดัชนี BMI ของผู้คน 10,000 คน ข้อมูลต้นฉบับมีป้ายกำกับ Gender สำหรับคน 5,000 คนที่ระบุตัวเองว่าเป็นเพศหญิง และอีก 5,000 คนเป็นเพศชาย ป้ายกำกับเหล่านี้จะเป็นประโยชน์ในภายหลังสำหรับการทดสอบว่าการจัดกลุ่มทำได้ดีเพียงใดเมื่อเปรียบเทียบกับป้ายกำกับจริง อย่างไรก็ตาม ในชุดข้อมูลย่อยนี้ยังไม่มีการระบุป้ายกำกับ
ข้อมูล gender_with_probs มีข้อมูลเพิ่มเติมคือความน่าจะเป็นที่แต่ละจุดข้อมูลจะอยู่ในกลุ่มใดกลุ่มหนึ่ง เนื่องจากเราสนใจสองกลุ่ม ค่าความน่าจะเป็นที่ใกล้ 1 จึงหมายถึงกลุ่มหนึ่ง และค่าที่ใกล้ 0 หมายถึงอีกกลุ่มหนึ่ง
เป้าหมายของแบบฝึกหัดนี้คือการสังเกตว่าชุดข้อมูลสำหรับการจัดกลุ่มทั่วไปมีลักษณะอย่างไร ทั้งก่อนและหลังการจัดกลุ่ม
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Mixture Models ใน R
คำแนะนำการฝึกหัด
- ใช้ฟังก์ชัน
headเพื่อดู 6 แถวแรกของgender - ใช้ฟังก์ชัน
headเพื่อดู 6 แถวแรกของgender_with_probs - สร้าง scatterplot โดยให้
Weightอยู่บนแกน x และBMIอยู่บนแกน y จากนั้นระบายสีจุดตามค่าความน่าจะเป็น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)