Spójny syntetyczny zbiór danych
Jednym z zastosowań danych syntetycznych w firmach jest trenowanie modeli sztucznej inteligencji i uczenia maszynowego. Dane rzeczywiste bywają kosztowne w zbieraniu lub po prostu trudno dostępne. Gdy dane treningowe są silnie niezbalansowane (np. ponad 90% przypadków należy do jednej klasy), generowanie danych syntetycznych może pomóc w budowaniu dokładnych modeli uczenia maszynowego.
W tym ćwiczeniu wygenerujesz zbiór danych z ocenami aplikacji mobilnej przy użyciu biblioteki Faker.
Początkowy obiekt DataFrame jest wczytany jako ratings i zawiera dwie kolumny: rating oraz gender. Generator Faker() został już zainicjalizowany jako fake_data.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]