探索資料的分佈
當我們想用更貼近真實的方式,透過抽樣來匿名化一個資料集時,需要先了解資料的領域知識與統計特性。如同先前所見,找出目標欄位的機率分佈是關鍵。
在這個練習中,你會探索 IBM HR 資料集(簡化版)中的 business_travel 欄位。
hr 已經匯入為 DataFrame,numpy 以 np 匯入。正如前一章所說,pandas 已以 pd 匯入,並會在本課程其餘內容中持續使用。
本練習屬於課程
Data Privacy and Anonymization in Python
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Print the absolute frequencies of each unique value
print(____)