เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

กำหนดจำนวนคลัสเตอร์ที่เหมาะสมที่สุด

ในแบบฝึกหัดนี้ จะใช้วิธี elbow criterion เพื่อหาจำนวนคลัสเตอร์ที่เหมาะสม โดยดูจากจุดที่ค่า squared sum of error ลดลงอย่างไม่มีนัยสำคัญ ขั้นตอนนี้ช่วยให้ได้จำนวนคลัสเตอร์เบื้องต้นในเชิงคณิตศาสตร์สำหรับนำไปทดสอบต่อ โดยจะวนซ้ำผ่านค่า k หลายค่า รัน KMeans สำหรับแต่ละค่า แล้ว plot ค่าความผิดพลาดเทียบกับแต่ละ k เพื่อหาจุด "elbow" ที่การลดลงของค่าความผิดพลาดเริ่มชะลอตัว

โมดูล KMeans โหลดมาจาก sklearn.cluster, ไลบรารี seaborn โหลดเป็น sns และโมดูล matplotlib.pyplot โหลดเป็น plt นอกจากนี้ ชุดข้อมูลที่ผ่านการ scale แล้วถูกโหลดเป็น wholesale_scaled_df ในรูปแบบ pandas DataFrame

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning สำหรับการตลาดด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง dictionary ว่างชื่อ sse
  • Fit อัลกอริทึม KMeans บนค่า k ตั้งแต่ 1 ถึง 11 และเก็บค่าความผิดพลาดไว้ใน dictionary sse
  • เพิ่ม title ให้กับกราฟ
  • สร้าง scatter plot โดยให้ keys อยู่บนแกน X และ values อยู่บนแกน Y แล้วแสดงกราฟ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create empty sse dictionary
sse = {}

# Fit KMeans algorithm on k values between 1 and 11
for k in ___(1, 11):
    kmeans = ___(n_clusters=___, random_state=333)
    kmeans.___(wholesale_scaled_df)
    sse[k] = kmeans.inertia_

# Add the title to the plot
plt.___('Elbow criterion method chart')

# Create and display a scatter plot
sns.pointplot(x=list(sse.___()), y=list(sse.___()))
plt.___()
แก้ไขและรันโค้ด