Konzistentní syntetická datová sada
Jedním z případů, kdy firmy využívají syntetická data, je trénování modelů umělé inteligence a strojového učení. Reálná data jsou někdy nákladná na sběr nebo se k nim prostě těžko dostává. Pokud jsou trénovací data silně nevyvážená (například více než 90 % instancí patří do jedné třídy), generování syntetických dat může pomoci vytvořit přesné modely strojového učení.
V tomto cvičení vygeneruješ datovou sadu hodnocení mobilní aplikace pomocí Faker.
Výchozí DataFrame je načtený jako ratings se dvěma sloupci: rating a gender. Generátor Faker() je už pro tebe inicializovaný jako fake_data.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]