開始使用免費開始

具有相同機率分佈的資料集

合成資料的目標,是在不危及個人重要資訊的前提下,建立一個盡可能真實的資料集。例如,Deloitte Consulting 的一個團隊透過合成資料產生了機器學習模型 80% 的訓練資料,最終的模型準確率與使用真實資料訓練的模型相近。

在這個練習中,你將使用 Faker 從零開始產生一個合成資料集,並使其遵循已載入為 p 的機率分佈。

Faker 產生器 fake_data 已經初始化,且已將 numpynp 匯入。

本練習屬於課程

Data Privacy and Anonymization in Python

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
編輯並執行程式碼