開始使用免費開始

一致性的合成資料集

企業使用合成資料的情境之一,是用來訓練人工智慧與機器學習模型。真實世界的資料有時蒐集成本高,或者不容易取得。當訓練資料高度不平衡(例如超過 90% 的樣本屬於同一類別)時,產生合成資料能協助建立更準確的機器學習模型。

在這個練習中,你將使用 Faker 產生一個行動 App 評分的資料集。

初始的 DataFrame 以 ratings 載入,包含兩個欄位:ratinggenderFaker() 產生器已為你初始化為 fake_data

本練習屬於課程

Data Privacy and Anonymization in Python

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
編輯並執行程式碼