Chuẩn hóa dữ liệu cá để phân cụm
Bạn được cung cấp một mảng samples chứa các phép đo của cá. Mỗi hàng tương ứng với một cá thể. Các phép đo, như cân nặng tính bằng gram, chiều dài tính bằng cm, và tỷ lệ phần trăm giữa chiều cao so với chiều dài, có thang đo rất khác nhau. Để phân cụm dữ liệu này hiệu quả, trước hết bạn cần chuẩn hóa các đặc trưng này. Trong bài tập này, bạn sẽ xây dựng một pipeline để chuẩn hóa và phân cụm dữ liệu.
Dữ liệu đo đạc cá này được lấy từ Journal of Statistics Education.
Bài tập này là một phần của khóa học
Unsupervised Learning bằng Python
Hướng dẫn bài tập
- Import:
make_pipelinetừsklearn.pipeline.StandardScalertừsklearn.preprocessing.KMeanstừsklearn.cluster.
- Tạo một thể hiện
StandardScalertên làscaler. - Tạo một thể hiện
KMeansvới4cụm tên làkmeans. - Tạo một pipeline tên
pipelineđể xâu chuỗiscalervàkmeans. Để làm điều này, bạn chỉ cần truyền chúng làm đối số chomake_pipeline().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create scaler: scaler
scaler = ____
# Create KMeans instance: kmeans
kmeans = ____
# Create pipeline: pipeline
pipeline = ____