ÎncepețiÎncepe gratuit

Seturi de date cu aceeași distribuție probabilistică

Scopul datelor sintetice este de a crea un set de date cât mai realist posibil, fără a pune în pericol informații personale importante. De exemplu, o echipă de la Deloitte Consulting a generat 80% din datele de antrenament pentru un model de machine learning prin sintetizarea datelor. Acuratețea modelului rezultat a fost similară cu cea a unui model antrenat pe date reale.

În acest exercițiu, vei genera un set de date sintetic de la zero folosind Faker, care urmează o distribuție probabilistică încărcată ca p.

Generatorul Faker fake_data a fost deja inițializat, iar numpy este importat ca np.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
Editează și rulează codul