การจัดกลุ่มข้อมูลปลา
ในแบบฝึกหัดนี้ จะใช้ pipeline สำหรับการทำ standardization และ clustering จากแบบฝึกหัดก่อนหน้า เพื่อจัดกลุ่มปลาตามข้อมูลการวัด จากนั้นสร้าง cross-tabulation เพื่อเปรียบเทียบ cluster labels กับสายพันธุ์ของปลา
เช่นเดิม samples คืออาร์เรย์ 2 มิติของข้อมูลการวัดปลา pipeline พร้อมใช้งานในตัวแปร pipeline และสายพันธุ์ของปลาแต่ละตัวอยู่ใน list species
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Unsupervised Learning ใน Python
คำแนะนำการฝึกหัด
- นำเข้า
pandasโดยใช้ชื่อแทนว่าpd - Fit pipeline กับข้อมูลการวัดปลา
samples - ดึง cluster labels ของ
samplesโดยใช้เมธอด.predict()ของpipeline - ใช้
pd.DataFrame()สร้าง DataFrame ชื่อdfที่มี 2 คอลัมน์ชื่อ'labels'และ'species'โดยใช้labelsและspeciesเป็นค่าของแต่ละคอลัมน์ตามลำดับ - ใช้
pd.crosstab()สร้าง cross-tabulation ชื่อctจากdf['labels']และdf['species']
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import pandas
import pandas as pd
# Fit the pipeline to samples
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame with labels and species as columns: df
df = ____
# Create crosstab: ct
ct = ____
# Display ct
print(ct)