ÎncepețiÎncepe gratuit

Set de date sintetic consistent

Un scenariu în care companiile folosesc date sintetice este antrenarea modelelor de inteligență artificială și de învățare automată. Datele din lumea reală sunt uneori costisitoare de colectat sau pur și simplu greu de obținut. Atunci când datele de antrenament sunt puternic dezechilibrate (de exemplu, mai mult de 90% din instanțe aparțin unei singure clase), generarea de date sintetice poate contribui la construirea unor modele de învățare automată mai precise.

În acest exercițiu, vei genera un set de date cu evaluări ale unei aplicații mobile folosind Faker.

DataFrame-ul inițial este încărcat ca ratings și conține două coloane: rating și gender. Un generator Faker() a fost deja inițializat pentru tine ca fake_data.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
Editează și rulează codul