Bắt đầu ngayBắt đầu miễn phí

Khám phá dữ liệu giới tính

Dữ liệu gender chứa các chỉ số Weight, HeightBMI của 10.000 người. Dữ liệu gốc có nhãn Gender cho 5.000 người tự nhận là nữ và 5.000 người còn lại là nam. Các nhãn này sẽ hữu ích sau này để kiểm tra mức độ hoạt động của phân cụm so với nhãn thực. Tuy nhiên, trong tập con của bộ dữ liệu này, các nhãn không được cung cấp.

Dữ liệu gender_with_probs cũng chứa xác suất mỗi điểm dữ liệu thuộc về một cụm. Vì chúng ta quan tâm đến hai cụm, các xác suất gần 1 tương ứng với một cụm và gần 0 với cụm còn lại.

Mục tiêu của bài tập này là giúp bạn hình dung dữ liệu phân cụm điển hình trông như thế nào trước và sau khi phân cụm.

Bài tập này là một phần của khóa học

Các Mô hình Hỗn hợp trong R

Xem khóa học

Hướng dẫn bài tập

  • Dùng hàm head để xem 6 quan sát đầu tiên của gender.
  • Dùng hàm head để xem 6 quan sát đầu tiên của gender_with_probs.
  • Vẽ biểu đồ phân tán với Weight trên trục x và BMI trên trục y. Tô màu các điểm theo xác suất của chúng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Have a look to gender (before clustering)
head(___)

# Have a look to gender_with_probs (after clustering)
head(___)

# Scatterplot with probabilities
gender_with_probs %>% 
  ggplot(aes(x = ___, y = ___, col = ___))+
  geom_point(alpha = 0.5)
Chỉnh sửa và Chạy Mã