Ensembles de données avec la même distribution probabiliste
L'objectif des données synthétiques est de créer un ensemble de données le plus réaliste possible, sans compromettre des renseignements personnels importants. Par exemple, une équipe de Deloitte Consulting a généré 80 % des données d'entraînement d'un modèle de machine learning en synthétisant des données. La précision obtenue était comparable à celle d'un modèle entraîné sur des données réelles.
Dans cet exercice, vous allez générer à partir de zéro un ensemble de données synthétiques avec Faker qui suit une distribution probabiliste chargée sous le nom p.
Le générateur Faker fake_data a déjà été initialisé et numpy est importé sous le nom np.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)