Phân cụm dữ liệu cá
Bây giờ bạn sẽ dùng pipeline chuẩn hóa và phân cụm từ bài trước để phân cụm các mẫu cá theo số đo của chúng, sau đó tạo một bảng chéo để so sánh nhãn cụm với loài cá.
Như trước, samples là mảng 2D chứa các số đo của cá. Pipeline của bạn có sẵn dưới tên pipeline, và loài của mỗi mẫu cá được cho bởi danh sách species.
Bài tập này là một phần của khóa học
Unsupervised Learning bằng Python
Hướng dẫn bài tập
- Import
pandasvới bí danhpd. - Fit pipeline vào dữ liệu số đo cá
samples. - Lấy nhãn cụm cho
samplesbằng phương thức.predict()củapipeline. - Dùng
pd.DataFrame()để tạo DataFramedfvới hai cột tên'labels'và'species', sử dụnglabelsvàspeciestương ứng làm giá trị cột. - Dùng
pd.crosstab()để tạo bảng chéocttừdf['labels']vàdf['species'].
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import pandas
import pandas as pd
# Fit the pipeline to samples
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame with labels and species as columns: df
df = ____
# Create crosstab: ct
ct = ____
# Display ct
print(ct)