Seturi de date cu aceeași distribuție probabilistică
Scopul datelor sintetice este de a crea un set de date cât mai realist posibil, fără a pune în pericol informații personale importante. De exemplu, o echipă de la Deloitte Consulting a generat 80% din datele de antrenament pentru un model de machine learning prin sintetizarea datelor. Acuratețea modelului rezultat a fost similară cu cea a unui model antrenat pe date reale.
În acest exercițiu, vei genera un set de date sintetic de la zero folosind Faker, care urmează o distribuție probabilistică încărcată ca p.
Generatorul Faker fake_data a fost deja inițializat, iar numpy este importat ca np.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)