K-means clustering
ในการสัมภาษณ์ด้าน machine learning คุณอาจถูกถามว่าผลลัพธ์จาก K-means clustering สามารถนำมาใช้ประเมินว่าอัลกอริทึมนี้เหมาะสมที่สุดได้อย่างไร
ในแบบฝึกหัดนี้จะได้ฝึกใช้ K-means clustering โดยใช้แอตทริบิวต์ .inertia_ เพื่อเปรียบเทียบโมเดลที่มีจำนวนคลัสเตอร์ k ต่างกัน จากนั้นจะนำข้อมูลนี้ไปใช้ประเมินจำนวนคลัสเตอร์ที่เหมาะสมในแบบฝึกหัดถัดไป
ขอให้นึกว่าตัวแปรเป้าหมายในชุดข้อมูล diabetes คือ progression
ตำแหน่งปัจจุบันใน pipeline:

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import module
from sklearn.cluster import KMeans
# Create feature matrix
X = diabetes.____("____", axis=1)
# Instantiate
kmeans = KMeans(n_clusters=2, random_state=123)
# Fit
fit = kmeans.____(____)
# Print inertia
print("Sum of squared distances for 2 clusters is", kmeans.inertia_)