Konsekvent syntetisk datamängd
Ett scenario där företag använder syntetiska data är träning av modeller för artificiell intelligens och maskininlärning. Verkliga data kan ibland vara dyra att samla in, eller helt enkelt svåra att få tag på. När träningsdata är kraftigt obalanserade – till exempel om mer än 90 % av instanserna tillhör en klass – kan generering av syntetiska data bidra till att bygga noggranna maskininlärningsmodeller.
I den här övningen genererar du en datamängd med betyg för en mobilapp med hjälp av Faker.
Startdataramen är inläst som ratings med två kolumner: rating och gender. En Faker()-generator har redan initierats åt dig som fake_data.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]