Kom igångKom igång gratis

Datamängder med samma sannolikhetsfördelning

Målet med syntetiska data är att skapa en datamängd som är så realistisk som möjligt, utan att äventyra viktig personlig information. Till exempel genererade ett team på Deloitte Consulting 80 % av träningsdatan för en maskininlärningsmodell genom att syntetisera data. Den resulterande modellens noggrannhet var liknande den hos en modell tränad på verkliga data.

I den här övningen genererar du en syntetisk datamängd från grunden med hjälp av Faker, som följer en sannolikhetsfördelning inläst som p.

Faker-generatorn fake_data har redan initierats och numpy är importerat som np.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
Redigera och kör kod