Vấn đề thực hành: chuẩn hóa (scaling)
Hãy nhớ từ video rằng khi phân cụm dữ liệu thực tế, bạn có thể cần chuẩn hóa (scaling) các đặc trưng nếu chúng có phân phối khác nhau. Đến giờ trong chương này, bạn đang làm việc với dữ liệu tổng hợp nên không cần chuẩn hóa.
Trong bài tập này, bạn sẽ quay lại làm việc với dữ liệu "thực" — bộ dữ liệu pokemon được giới thiệu ở chương đầu. Bạn sẽ quan sát phân phối (trung bình và độ lệch chuẩn) của từng đặc trưng, chuẩn hóa dữ liệu tương ứng, rồi xây dựng một mô hình phân cụm phân cấp (hierarchical clustering) dùng phương pháp liên kết hoàn chỉnh (complete linkage).
Bài tập này là một phần của khóa học
Học không giám sát với R
Hướng dẫn bài tập
Dữ liệu được lưu trong đối tượng pokemon trong không gian làm việc của bạn.
- Xem giá trị trung bình của từng biến trong
pokemonbằng hàmcolMeans(). - Xem độ lệch chuẩn của từng biến bằng các hàm
apply()vàsd(). Vì các biến nằm ở các cột của ma trận, hãy đảm bảo chỉ định 2 cho đối sốMARGINcủaapply(). - Chuẩn hóa dữ liệu
pokemonbằng hàmscale()và lưu kết quả vàopokemon.scaled. - Tạo một mô hình phân cụm phân cấp cho dữ liệu
pokemon.scaleddùng phương pháp liên kết hoàn chỉnh (complete linkage). Tự chỉ định đối sốmethodvà lưu kết quả vàohclust.pokemon.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon