เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

K-means clustering: แบบฝึกหัดแรก

แบบฝึกหัดนี้จะช่วยให้คุ้นเคยกับการใช้งาน k-means clustering กับชุดข้อมูล ลองนำชุดข้อมูล Comic Con มาทดสอบดูว่า k-means clustering ทำงานอย่างไร

ทบทวนสองขั้นตอนของ k-means clustering:

  • กำหนดจุดศูนย์กลางของคลัสเตอร์ผ่านฟังก์ชัน kmeans() โดยต้องระบุอาร์กิวเมนต์บังคับสองตัว ได้แก่ observations และจำนวนคลัสเตอร์
  • กำหนด label ของคลัสเตอร์ผ่านฟังก์ชัน vq() โดยต้องระบุอาร์กิวเมนต์บังคับสองตัว ได้แก่ observations และจุดศูนย์กลางของคลัสเตอร์

ข้อมูลถูกเก็บอยู่ใน pandas DataFrame ชื่อ comic_con โดย x_scaled และ y_scaled คือชื่อคอลัมน์ที่เก็บค่าพิกัด X และ Y ที่ผ่านการ standardize แล้ว สำหรับตำแหน่งของบุคคลในช่วงเวลาหนึ่ง

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์กลุ่มข้อมูลใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าฟังก์ชัน kmeans และ vq จาก SciPy
  • สร้างจุดศูนย์กลางของคลัสเตอร์โดยใช้ฟังก์ชัน kmeans() กำหนดให้มี 2 คลัสเตอร์
  • สร้าง label ของคลัสเตอร์โดยใช้จุดศูนย์กลางที่ได้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
แก้ไขและรันโค้ด