Zbiory danych z takim samym rozkładem prawdopodobieństwa
Celem danych syntetycznych jest stworzenie zbioru danych, który jest możliwie jak najbardziej realistyczny, a jednocześnie nie narusza ważnych informacji osobistych. Na przykład zespół w Deloitte Consulting wygenerował 80% danych treningowych dla modelu uczenia maszynowego, syntetyzując dane. Dokładność wynikowego modelu była zbliżona do modelu wytrenowanego na prawdziwych danych.
W tym ćwiczeniu wygenerujesz syntetyczny zbiór danych od podstaw, używając Faker, który będzie następował za rozkładem prawdopodobieństwa załadowanym jako p.
Generator Faker o nazwie fake_data został już zainicjalizowany, a numpy jest zaimportowany jako np.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)