Bắt đầu ngayBắt đầu miễn phí

Chuẩn hóa dữ liệu cá để phân cụm

Bạn được cung cấp một mảng samples chứa các phép đo của cá. Mỗi hàng tương ứng với một cá thể. Các phép đo, như cân nặng tính bằng gram, chiều dài tính bằng cm, và tỷ lệ phần trăm giữa chiều cao so với chiều dài, có thang đo rất khác nhau. Để phân cụm dữ liệu này hiệu quả, trước hết bạn cần chuẩn hóa các đặc trưng này. Trong bài tập này, bạn sẽ xây dựng một pipeline để chuẩn hóa và phân cụm dữ liệu.

Dữ liệu đo đạc cá này được lấy từ Journal of Statistics Education.

Bài tập này là một phần của khóa học

Unsupervised Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import:
    • make_pipeline từ sklearn.pipeline.
    • StandardScaler từ sklearn.preprocessing.
    • KMeans từ sklearn.cluster.
  • Tạo một thể hiện StandardScaler tên là scaler.
  • Tạo một thể hiện KMeans với 4 cụm tên là kmeans.
  • Tạo một pipeline tên pipeline để xâu chuỗi scalerkmeans. Để làm điều này, bạn chỉ cần truyền chúng làm đối số cho make_pipeline().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create scaler: scaler
scaler = ____

# Create KMeans instance: kmeans
kmeans = ____

# Create pipeline: pipeline
pipeline = ____
Chỉnh sửa và Chạy Mã