Začněte nyníZačněte zdarma

Datasety se stejným pravděpodobnostním rozdělením

Cílem syntetických dat je vytvořit dataset, který je co nejrealističtější, aniž by přitom ohrozil důležité osobní údaje. Například tým v Deloitte Consulting vygeneroval 80 % trénovacích dat pro model strojového učení syntézou dat. Výsledná přesnost modelu byla srovnatelná s modelem trénovaným na reálných datech.

V tomto cvičení vytvoříš syntetický dataset od základu pomocí Faker, který bude sledovat pravděpodobnostní rozdělení načtené jako p.

Generátor Faker s názvem fake_data je již inicializován a numpy je importován jako np.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
Upravit a spustit kód