Bắt đầu ngayBắt đầu miễn phí

Phân cụm dữ liệu cá

Bây giờ bạn sẽ dùng pipeline chuẩn hóa và phân cụm từ bài trước để phân cụm các mẫu cá theo số đo của chúng, sau đó tạo một bảng chéo để so sánh nhãn cụm với loài cá.

Như trước, samples là mảng 2D chứa các số đo của cá. Pipeline của bạn có sẵn dưới tên pipeline, và loài của mỗi mẫu cá được cho bởi danh sách species.

Bài tập này là một phần của khóa học

Unsupervised Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import pandas với bí danh pd.
  • Fit pipeline vào dữ liệu số đo cá samples.
  • Lấy nhãn cụm cho samples bằng phương thức .predict() của pipeline.
  • Dùng pd.DataFrame() để tạo DataFrame df với hai cột tên 'labels''species', sử dụng labelsspecies tương ứng làm giá trị cột.
  • Dùng pd.crosstab() để tạo bảng chéo ct từ df['labels']df['species'].

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import pandas
import pandas as pd

# Fit the pipeline to samples
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame with labels and species as columns: df
df = ____

# Create crosstab: ct
ct = ____

# Display ct
print(ct)
Chỉnh sửa và Chạy Mã