Datasety se stejným pravděpodobnostním rozdělením
Cílem syntetických dat je vytvořit dataset, který je co nejrealističtější, aniž by přitom ohrozil důležité osobní údaje. Například tým v Deloitte Consulting vygeneroval 80 % trénovacích dat pro model strojového učení syntézou dat. Výsledná přesnost modelu byla srovnatelná s modelem trénovaným na reálných datech.
V tomto cvičení vytvoříš syntetický dataset od základu pomocí Faker, který bude sledovat pravděpodobnostní rozdělení načtené jako p.
Generátor Faker s názvem fake_data je již inicializován a numpy je importován jako np.
Toto cvičení je součástí kurzu
Ochrana soukromí a anonymizace dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)