Rzadkość macierzy
Typowym wyzwaniem w rzeczywistych danych z ocenami jest to, że większość użytkowników nie oceniła większości elementów, a większość elementów otrzymała oceny tylko od niewielkiej liczby użytkowników. Prowadzi to do bardzo pustego, czyli rzadkiego DataFrame.
W tym ćwiczeniu obliczysz, jak rzadkie są dane z ocenami movie_lens, licząc zajęte komórki i porównując ich liczbę z rozmiarem całego DataFrame.
DataFrame user_ratings_df, którego używałeś w poprzednich ćwiczeniach – zawierający jeden wiersz na użytkownika i jedną kolumnę na film – został już wczytany.
To ćwiczenie jest częścią kursu
Budowanie systemów rekomendacji w Pythonie
Instrukcje do ćwiczenia
- Zlicz liczbę niepustych komórek w
user_ratings_dfi zapisz wynik jakosparsity_count. - Zlicz całkowitą liczbę komórek w DataFrame
user_ratings_dfi zapisz ją jakofull_count. - Oblicz rzadkość DataFrame, dzieląc liczbę niepustych komórek przez całkowitą liczbę komórek, i wyświetl wynik.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Count the occupied cells
sparsity_count = user_ratings_df.____().____.____()
# Count all cells
full_count = user_ratings_df.____
# Find the sparsity of the DataFrame
sparsity = ____ / ____
print(sparsity)