開始使用免費開始

在類別型資料上使用階層

在這個練習中,你會建立並使用階層,對 US Adult Income 資料集的 bachelors 欄進行資料概化(generalization)。

我們已替你準備好含有階層的初始字典 hierarchies。其中包含 3 種學歷類別:PrimarySecondaryHigher;每個類別都有對應到資料中的學歷值清單。你可以在互動式主控台中自由查看。

我們會建立一個新字典,用來存放概化後的學歷資訊,並用它取代原始值。

資料集已載入為 income_df

本練習屬於課程

Data Privacy and Anonymization in Python

檢視課程

練習說明

  • education_hierarchy 初始化為空字典。
  • 完成內層迴圈,將學歷類別 key 指派為值。例如 {'Some-college': 'Higher education'}
  • 將學歷階層概化套用到 bachelors 欄,並將結果指定到新欄位 bachelors_generalized

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
編輯並執行程式碼