Začněte nyníZačněte zdarma

Konzistentní syntetická datová sada

Jedním z případů, kdy firmy využívají syntetická data, je trénování modelů umělé inteligence a strojového učení. Reálná data jsou někdy nákladná na sběr nebo se k nim prostě těžko dostává. Pokud jsou trénovací data silně nevyvážená (například více než 90 % instancí patří do jedné třídy), generování syntetických dat může pomoci vytvořit přesné modely strojového učení.

V tomto cvičení vygeneruješ datovou sadu hodnocení mobilní aplikace pomocí Faker.

Výchozí DataFrame je načtený jako ratings se dvěma sloupci: rating a gender. Generátor Faker() je už pro tebe inicializovaný jako fake_data.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
Upravit a spustit kód