Set de date sintetic consistent
Un scenariu în care companiile folosesc date sintetice este antrenarea modelelor de inteligență artificială și de învățare automată. Datele din lumea reală sunt uneori costisitoare de colectat sau pur și simplu greu de obținut. Atunci când datele de antrenament sunt puternic dezechilibrate (de exemplu, mai mult de 90% din instanțe aparțin unei singure clase), generarea de date sintetice poate contribui la construirea unor modele de învățare automată mai precise.
În acest exercițiu, vei genera un set de date cu evaluări ale unei aplicații mobile folosind Faker.
DataFrame-ul inițial este încărcat ca ratings și conține două coloane: rating și gender. Un generator Faker() a fost deja inițializat pentru tine ca fake_data.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]