เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้างชุดข้อมูลสำหรับการทำ Clustering

ข้อมูลสังเคราะห์ถูกกฎหมายอย่างสมบูรณ์และเป็นไปตามข้อกำหนดของกฎหมายและข้อบังคับด้านความเป็นส่วนตัวทั่วโลก นับเป็นทางเลือกที่คำนึงถึงความเป็นส่วนตัวแทนการใช้ข้อมูลดิบ ฟังก์ชัน make_blobs() ใช้สร้างจุดข้อมูลที่มีการแจกแจงแบบ Gaussian (หรือ Normal distribution)

ในแบบฝึกหัดนี้ จะสร้างชุดข้อมูลที่มี 15000 ตัวอย่าง

numpy ถูก import ไว้แล้วในชื่อ np และฟังก์ชัน plot_data_points() ที่กำหนดเองก็ถูกเตรียมไว้ให้สำหรับแบบฝึกหัดนี้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import ฟังก์ชันที่เหมาะสมจากโมดูล datasets สำหรับการสร้างชุดข้อมูล Clustering
  • สร้างชุดข้อมูลที่มี 15000 ตัวอย่าง โดยกำหนด 2 features, 2 centers และค่าเบี่ยงเบนมาตรฐานของ Cluster เป็น 3
  • แสดงขนาด (shape) ของข้อมูลที่สร้างขึ้น
  • ตรวจสอบจุดข้อมูลที่ได้ในรูปแบบ Scatter plot แบบ 2 มิติ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
แก้ไขและรันโค้ด