Zacznij terazZacznij za darmo

Zbiory danych z takim samym rozkładem prawdopodobieństwa

Celem danych syntetycznych jest stworzenie zbioru danych, który jest możliwie jak najbardziej realistyczny, a jednocześnie nie narusza ważnych informacji osobistych. Na przykład zespół w Deloitte Consulting wygenerował 80% danych treningowych dla modelu uczenia maszynowego, syntetyzując dane. Dokładność wynikowego modelu była zbliżona do modelu wytrenowanego na prawdziwych danych.

W tym ćwiczeniu wygenerujesz syntetyczny zbiór danych od podstaw, używając Faker, który będzie następował za rozkładem prawdopodobieństwa załadowanym jako p.

Generator Faker o nazwie fake_data został już zainicjalizowany, a numpy jest zaimportowany jako np.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
Edytuj i uruchom kod