一致性的合成資料集
企業使用合成資料的情境之一,是用來訓練人工智慧與機器學習模型。真實世界的資料有時蒐集成本高,或者不容易取得。當訓練資料高度不平衡(例如超過 90% 的樣本屬於同一類別)時,產生合成資料能協助建立更準確的機器學習模型。
在這個練習中,你將使用 Faker 產生一個行動 App 評分的資料集。
初始的 DataFrame 以 ratings 載入,包含兩個欄位:rating 與 gender。Faker() 產生器已為你初始化為 fake_data。
本練習屬於課程
Data Privacy and Anonymization in Python
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]