Cinsiyet verisini keşfet
gender verisi, 10.000 kişinin Weight, Height ve BMI değerlerini içerir. Orijinal veride, kendini kadın olarak tanımlayan 5.000 kişi ve erkek olarak tanımlayan diğer 5.000 kişi için bir Gender etiketi vardır. Bu etiketler, kümelemenin gerçek etiketlerle ne kadar iyi örtüştüğünü test etmek için ileride işine yarayacak. Ancak bu veri kümesinin bu alt kümesinde etiketler verilmemiştir.
gender_with_probs verisi ayrıca her bir veri noktasının bir kümeye ait olma olasılıklarını da içerir. İki kümeyle ilgilendiğimiz için, 1e yakın olasılıklar bir kümeye, 0a yakın olanlar ise diğer kümeye karşılık gelir.
Bu egzersizin amacı, tipik bir kümelenme veri kümesinin kümelenmeden önce ve sonra nasıl göründüğüne hızlıca göz atmandır.
Bu egzersiz, kursun bir parçasıdır
R ile Karışım Modelleri
Egzersiz talimatları
headfonksiyonunu kullanarakgenderın ilk 6 gözlemine bak.headfonksiyonunu kullanarakgender_with_probsun ilk 6 gözlemine bak.- x ekseninde
Weight, y eksenindeBMIolacak şekilde bir saçılım grafiği oluştur. Noktaları olasılıklarına göre renklendir.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Have a look to gender (before clustering)
head(___)
# Have a look to gender_with_probs (after clustering)
head(___)
# Scatterplot with probabilities
gender_with_probs %>%
ggplot(aes(x = ___, y = ___, col = ___))+
geom_point(alpha = 0.5)