Kom igångKom igång gratis

Konsekvent syntetisk datamängd

Ett scenario där företag använder syntetiska data är träning av modeller för artificiell intelligens och maskininlärning. Verkliga data kan ibland vara dyra att samla in, eller helt enkelt svåra att få tag på. När träningsdata är kraftigt obalanserade – till exempel om mer än 90 % av instanserna tillhör en klass – kan generering av syntetiska data bidra till att bygga noggranna maskininlärningsmodeller.

I den här övningen genererar du en datamängd med betyg för en mobilapp med hjälp av Faker.

Startdataramen är inläst som ratings med två kolumner: rating och gender. En Faker()-generator har redan initierats åt dig som fake_data.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
Redigera och kör kod