Zacznij terazZacznij za darmo

Spójny syntetyczny zbiór danych

Jednym z zastosowań danych syntetycznych w firmach jest trenowanie modeli sztucznej inteligencji i uczenia maszynowego. Dane rzeczywiste bywają kosztowne w zbieraniu lub po prostu trudno dostępne. Gdy dane treningowe są silnie niezbalansowane (np. ponad 90% przypadków należy do jednej klasy), generowanie danych syntetycznych może pomóc w budowaniu dokładnych modeli uczenia maszynowego.

W tym ćwiczeniu wygenerujesz zbiór danych z ocenami aplikacji mobilnej przy użyciu biblioteki Faker.

Początkowy obiekt DataFrame jest wczytany jako ratings i zawiera dwie kolumny: rating oraz gender. Generator Faker() został już zainicjalizowany jako fake_data.

To ćwiczenie jest częścią kursu

Prywatność danych i anonimizacja w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
Edytuj i uruchom kod