or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
เริ่มต้นด้วยการประยุกต์ใช้เทคนิคการทำให้ข้อมูลไม่ระบุตัวตน เช่น data suppression, masking, การสร้างข้อมูลสังเคราะห์ (synthetic data generation) และ generalization ในบทนี้ คุณจะได้เรียนรู้วิธีแยกแยะข้อมูลที่สามารถระบุตัวตนได้ทั้งแบบอ่อนไหวและไม่อ่อนไหว (PII) quasi-identifiers และหลักการพื้นฐานของ GDPR พร้อมตัวอย่างจากสถานการณ์จริงที่แสดงให้เห็นว่าจะเกิดอะไรขึ้นหากไม่ปฏิบัติตามแนวทางเหล่านี้
เรียนรู้วิธีทำให้ข้อมูลไม่ระบุตัวตนโดยการสุ่มตัวอย่างจากชุดข้อมูลตามการกระจายความน่าจะเป็นของแต่ละคอลัมน์ จากนั้นจะได้ศึกษาการนำโมเดล k-anonymity ไปใช้เพื่อป้องกันการโจมตีแบบ linkage และ re-identification รวมถึงการใช้ hierarchies เพื่อทำ data generalization สำหรับตัวแปรเชิงหมวดหมู่
เรียนรู้เรื่อง differential privacy ซึ่งเป็นโมเดลที่บริษัทเทคโนโลยีชั้นนำอย่าง Apple, Google และ Uber นำไปใช้จริง ในบทนี้ คุณจะสำรวจข้อมูลด้วยการสร้างฮิสโตแกรมแบบ private และคำนวณค่าเฉลี่ยแบบ private นอกจากนี้ยังจะได้สร้างโมเดล machine learning ที่ใช้ differential privacy เพื่อช่วยให้ธุรกิจได้ประโยชน์สูงสุดจากข้อมูลของตน
ในบทสุดท้ายนี้ คุณจะได้เรียนรู้การใช้วิธีลดมิติข้อมูล (dimensionality reduction) เช่น principal component analysis (PCA) เพื่อทำให้ชุดข้อมูลขนาดใหญ่ที่มีหลายคอลัมน์ไม่ระบุตัวตน จากนั้นจะใช้ Faker ในการสร้างชุดข้อมูลที่สมจริงและสอดคล้องกัน และใช้ scikit-learn สร้างชุดข้อมูลสังเคราะห์ที่เป็นไปตามการกระจายแบบปกติ สุดท้ายคือการนำทุกสิ่งที่เรียนมาตลอดคอร์สมารวมกัน เพื่อเผยแพร่ชุดข้อมูลต่อสาธารณะได้อย่างปลอดภัย
แบบฝึกหัดปัจจุบัน