在類別型資料上使用階層
在這個練習中,你會建立並使用階層,對 US Adult Income 資料集的 bachelors 欄進行資料概化(generalization)。
我們已替你準備好含有階層的初始字典 hierarchies。其中包含 3 種學歷類別:Primary、Secondary 和 Higher;每個類別都有對應到資料中的學歷值清單。你可以在互動式主控台中自由查看。
我們會建立一個新字典,用來存放概化後的學歷資訊,並用它取代原始值。
資料集已載入為 income_df。
本練習屬於課程
Data Privacy and Anonymization in Python
練習說明
- 將
education_hierarchy初始化為空字典。 - 完成內層迴圈,將學歷類別
key指派為值。例如{'Some-college': 'Higher education'}。 - 將學歷階層概化套用到
bachelors欄,並將結果指定到新欄位bachelors_generalized。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())