การเตรียมข้อมูลล่วงหน้า
การเตรียมข้อมูลล่วงหน้าสำหรับการจัดกลุ่ม (clustering) เป็นวิธีหนึ่งในการเตรียมข้อมูลเพื่อให้การแบ่งกลุ่มมีความแม่นยำมากขึ้น เทคนิคหนึ่งที่ใช้บ่อยคือการปรับสเกลฟีเจอร์ (feature scaling) ซึ่งช่วยทำให้ฟีเจอร์อิสระในข้อมูลอยู่ในช่วงค่าที่กำหนด เช่น 0-1 หรือ 0-100
ในแบบฝึกหัดนี้ จะทำการจัดกลุ่มบนคอลัมน์ parental_level_of_education และ writing_score ในชุดข้อมูลผลการเรียนของนักเรียนที่โหลดเป็น performance โดยเริ่มจากการสร้างและรันโมเดล k-means โดยไม่มีการเตรียมข้อมูลล่วงหน้า จากนั้นทำซ้ำแต่เพิ่มการปรับสเกลฟีเจอร์
โมเดล k-means แบบ private ถูกนำเข้ามาแล้วในชื่อ KMeans จาก diffprivlib.models พร้อมกับ StandardScaler และ PCA สำหรับลดมิติข้อมูลที่นำเข้าจาก sklearn
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Build the differentially private k-means model
model = KMeans(____)
# Fit the model to the data
____
# Print the inertia in the console output
print("The inertia of the private model is: ", model.inertia_)