เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สำรวจข้อมูลเพศ

ข้อมูล gender ประกอบด้วย Weight, Height และดัชนี BMI ของผู้คน 10,000 คน ข้อมูลต้นฉบับมีป้ายกำกับ Gender สำหรับคน 5,000 คนที่ระบุตัวเองว่าเป็นเพศหญิง และอีก 5,000 คนเป็นเพศชาย ป้ายกำกับเหล่านี้จะเป็นประโยชน์ในภายหลังสำหรับการทดสอบว่าการจัดกลุ่มทำได้ดีเพียงใดเมื่อเปรียบเทียบกับป้ายกำกับจริง อย่างไรก็ตาม ในชุดข้อมูลย่อยนี้ยังไม่มีการระบุป้ายกำกับ

ข้อมูล gender_with_probs มีข้อมูลเพิ่มเติมคือความน่าจะเป็นที่แต่ละจุดข้อมูลจะอยู่ในกลุ่มใดกลุ่มหนึ่ง เนื่องจากเราสนใจสองกลุ่ม ค่าความน่าจะเป็นที่ใกล้ 1 จึงหมายถึงกลุ่มหนึ่ง และค่าที่ใกล้ 0 หมายถึงอีกกลุ่มหนึ่ง

เป้าหมายของแบบฝึกหัดนี้คือการสังเกตว่าชุดข้อมูลสำหรับการจัดกลุ่มทั่วไปมีลักษณะอย่างไร ทั้งก่อนและหลังการจัดกลุ่ม

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Mixture Models ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ฟังก์ชัน head เพื่อดู 6 แถวแรกของ gender
  • ใช้ฟังก์ชัน head เพื่อดู 6 แถวแรกของ gender_with_probs
  • สร้าง scatterplot โดยให้ Weight อยู่บนแกน x และ BMI อยู่บนแกน y จากนั้นระบายสีจุดตามค่าความน่าจะเป็น

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
แก้ไขและรันโค้ด