การสร้างชุดข้อมูลสำหรับการทำ Clustering
ข้อมูลสังเคราะห์ถูกกฎหมายอย่างสมบูรณ์และเป็นไปตามข้อกำหนดของกฎหมายและข้อบังคับด้านความเป็นส่วนตัวทั่วโลก นับเป็นทางเลือกที่คำนึงถึงความเป็นส่วนตัวแทนการใช้ข้อมูลดิบ ฟังก์ชัน make_blobs() ใช้สร้างจุดข้อมูลที่มีการแจกแจงแบบ Gaussian (หรือ Normal distribution)
ในแบบฝึกหัดนี้ จะสร้างชุดข้อมูลที่มี 15000 ตัวอย่าง
numpy ถูก import ไว้แล้วในชื่อ np และฟังก์ชัน plot_data_points() ที่กำหนดเองก็ถูกเตรียมไว้ให้สำหรับแบบฝึกหัดนี้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
คำแนะนำการฝึกหัด
- Import ฟังก์ชันที่เหมาะสมจากโมดูล
datasetsสำหรับการสร้างชุดข้อมูล Clustering - สร้างชุดข้อมูลที่มี
15000ตัวอย่าง โดยกำหนด2features,2centers และค่าเบี่ยงเบนมาตรฐานของ Cluster เป็น3 - แสดงขนาด (shape) ของข้อมูลที่สร้างขึ้น
- ตรวจสอบจุดข้อมูลที่ได้ในรูปแบบ Scatter plot แบบ 2 มิติ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)